2026-09-23
5880
罗福莉从未遮掩对“天才少女”这四个字的嫌弃。 去年,她公开吐槽那些写自己的文章:事实错误一堆,如果自己是一个不认识罗福莉的人,看完也会默默给“买热搜”的评论点个赞。 一年多后,罗福莉又成了话题人物。这回模型还没练完,小米就把训练进度挂到了网上“直播”。外界围观了几天,终于在9月22日等来了MiMo-V2.6正式发布。 其中,Pro登上了Artificial Analysis综合智能指数的开放权重模型榜首。 小米还把技术报告、模型的RL版权重,以及约7000个训练任务环境和配套框架一并开放。同行看完热闹,可以直接拿回去研究。面向普通用户的桌面客户端,也随着新模型上线了。 强化学习研究者Nathan Lambert直呼“有气势”。 做到这一步,当初那些围绕罗福莉的讨论,也该往前走走了。 从她去年11月公开宣布加入小米算起,到现在不过十个月。大公司重金请来的年轻AI负责人,这两年大家见了不少。能在这么短的时间里,让原本在头部竞争中存在感不强的公司拿到这样的成绩,还带出一条清楚的研究路线,放眼海内外,确实没几个人做到了。 小米如今对强化学习的投入、对Agent的押注,已经有了相当鲜明的辨识度。 A 围观了几天小米烧钱,这么快就可以验收成果了。 北京时间9月22日,小米正式发布MiMo-V2.6系列,之前在“直播间”里埋头训练的Pro和Flash,一起交了卷。 两款都是原生全模态模型,文字、图片、音频、视频都能处理,模型权重也同步开放了。 成绩确实拿得出手。 在第三方评测机构Artificial Analysis的综合智能指数中,MiMo-V2.6-Pro拿到46分,登上当时的开放权重模型榜首。 作为参照,上一代V2.5-Pro的成绩是26分。从26到46,这次更新的动静,显然比版本号里那个小数点看着大多了。 这张成绩单之外,价格也很难让开发者忽略。 MiMo-V2.6沿用了上一代的API价格。按每百万Token计算,Pro的常规输入价格为3元,输出6元。更便宜的Flash,输入1元,输出2元。 也就是说, 能力往上涨了一截,收费还是原来的收费。 把罗福莉老东家的价格表拿来并排看看,就更有意思了。 截至发稿,DeepSeek-V4.1-Flash每百万Token的输出价格,空闲时段是4元,高峰时段是8元。MiMo Flash的2元,只有前者的一半、后者的四分之一。常规输入方面,小米的1元与DeepSeek空闲时段持平,也低于它高峰时段的2元。 至少从价目表上看,开发者已经多了一个值得试试的选择。DeepSeek要继续吸引那些精打细算的用户,价格优势恐受影响。 老东家还出现在了罗福莉自己的发布感言里。 她在X上写道: “在我看来,它背后的研究创新和工程挑战超过了DeepSeek R1,后者我曾部分参与。” 这话说得很有锐气。 这次交出来的东西,够同行研究一阵子了。模型上线只是其中一环。罗福莉和MiMo团队这次打的,是一套组合拳。 B 罗福莉给那条长帖起的标题,直译过来是《MiMo-V2.6:扩展RL的艰难之路》。 她说,按计算投入衡量, 这很可能是迄今为止,开源模型团队进行过的最大规模单次RL训练。 同时,罗福莉专门“推销”了团队发在HuggingFace上的研究报告,预言 “我相信它将成为智能体强化学习实践者不断重新审视并每次都有新发现的经典论文之一” 。 RL即强化学习。拿写代码来说,就是给模型一个任务,让它自己尝试,再根据结果打分,用反馈调整模型,让有效的做法更容易在下一次出现。 小米这次想摸清的是增加尝试、扩充任务,再花更多算力检查结果,最终能让模型再进步多少。按照技术报告,一次训练更新会安排1568条任务提示,每条尝试16次,合计约2.5万次完整尝试。一次尝试里,又可能包含很多轮查文件、改代码和检查结果。 这些任务的耗时差别很大,有的很快就能做完,有的却要反复尝试很久,没法等所有任务都结束了再一起评分、训练。团队得把整个流程衔接好,尽量减少机器闲着等结果的时间,这本身就是一道工程难题。 直播页面上一个不起眼的“训练步骤”,里面其实忙得很。 而且,忙活半天,模型还可能把聪明才智用错地方。 报告写道,团队在早期实验中发现,MiMo会去找现成答案。让它修复某个软件历史版本的问题,它会下载更新的软件包,查上游补丁,寻找已经修好的代码。 这类训练要求模型根据指定版本完成修复,直接去网上翻答案说白了无异于某种“作弊”,是达不到测试MiMo解决问题能力的目的的。 于是,团队得清理可能泄露答案的文件和缓存,限制相关网络访问,还专门安排一个Agent去找剩下的漏洞。 即便代码通过了测试,也还要 比较解决方案的质量 。比如如果一种修法只改了必要的几行,另一种却加了一堆多余的东西,后面维护起来可能让人头大。团队为此让评分Agent检查多次尝试,区分方