①
9 月 21 日小米 MiMo 团队出新的 V2.6 系列并且全部开源,一共 Pro、Flash、Ultraspeed 三款模型。
其中 Pro 版本在 Artificial Analysis 智能指数拿到 46 分,高于 Qwen3.8 Max(45分)和 Kimi K3(44分),做到全球开源模型第一。
②
9 月 22 日 6:27,小米 MiMo 大模型负责人罗福莉发文介绍 MiMo‑V2.6,这套模型算得上开源圈史上算力投入最大的单次强化学习项目之一。现在算力资源十分紧张,但他们还是拉出几十人的团队,死磕强化学习规模化这条难走的路线。
模型潜力来自中期训练,再靠高强度强化学习彻底激活,目前综合实力位居开源模型第一。她认为这份技术报告值得行业反复研读,整体创新和工程难度,甚至超过自己参与过一部分的 DeepSeek R1。
针对大家疑惑为什么主推 MixRL 而不用 MOPD,她解释两者不是二选一。MixRL 用来处理中等难度、结果可核验的任务;长时序、不好验证的任务单独训练,再用 MOPD 整合各类能力。还有一个现实因素:团队架构扁平没有壁垒,推行这套方案阻力很小。
为推动行业发展,团队还开源了蒸馏模型、七千套环境和完整强化学习框架。MiMo‑V2.6 只是起步,即便 AI 成果很容易复制,他们还是坚持啃硬骨头,向着 AI 自我优化和通用人工智能继续往前走。
③
罗福莉给她的文章配了这张封图:
由于左侧的蒲公英有点像 Claude 的菊花 logo,所以有人调侃“左边其他人蒸馏 Claude,右边 Mimo 登山”