找工位
空间入驻
小程序

只用了10个月!那个被叫“天才少女”的人,交卷了

2026-09-23 05:01:37

你有没有发现,越是被人贴上“天才”标签的人,越容易被质疑“是不是吹过头了”?

罗福莉就是这样。入职小米不过十个月,外界讨论她的学历、年龄、身价,却很少有人关心她到底在做什么。

直到9月22日,模型发布,这份阶段性答卷,终于让讨论回到了研究本身。

十个月,从质疑到交卷

小米重金请来的年轻AI负责人,这两年大家见了不少。能在这么短时间里拿出成绩的,确实不多。

🚀 一场被“围观”的训练

这次发布前,小米把训练进度挂到了网上“直播”。

外界围观了几天,9月22日终于等来MiMo-V2.6系列正式发布。ProFlash两款都是原生全模态模型,文字、图片、音频、视频都能处理,模型权重同步开放。

成绩确实拿得出手。

在第三方评测机构Artificial Analysis的综合智能指数中,MiMo-V2.6-Pro拿到46分,登上当时的开放权重模型榜首。上一代V2.5-Pro的成绩是26分。从26到46,这次更新的动静,比版本号里那个小数点看着大多了。

强化学习研究者Nathan Lambert直呼“有气势”。

💰 价格,也很难让开发者忽略

MiMo-V2.6沿用了上一代的API价格。按每百万Token计算,Pro的常规输入3元,输出6元。更便宜的Flash,输入1元,输出2元。

能力往上涨了一截,收费还是原来的收费。

把罗福莉老东家的价格表并排看看,就更有意思了。MiMo Flash的2元输出价,比同行空闲时段的一半还低。至少从价目表上看,开发者已经多了一个值得试试的选择。

罗福莉自己在发布感言里写道:

“在我看来,它背后的研究创新和工程挑战超过了DeepSeek R1,后者我曾部分参与。”

这话说得很有锐气。

一套组合拳,不只是模型

模型上线只是其中一环。罗福莉和MiMo团队这次打的,是一套组合拳。

🔬 一场大规模强化学习实验

罗福莉给长帖起的标题是《MiMo-V2.6:扩展RL的艰难之路》。

她说,按计算投入衡量,这很可能是迄今为止,开源模型团队进行过的最大规模单次RL训练。

RL就是强化学习。拿写代码来说,给模型一个任务,让它自己尝试,再根据结果打分,用反馈调整模型,让有效的做法更容易在下一次出现。

按照技术报告,一次训练更新会安排1568条任务提示,每条尝试16次,合计约2.5万次完整尝试。一次尝试里,又可能包含很多轮查文件、改代码和检查结果。

团队还得把整个流程衔接好,尽量减少机器闲着等结果的时间。这本身就是一道工程难题。

⚠️ 模型也会“耍小聪明”

报告写道,团队在早期实验中发现,MiMo会去找现成答案。让它修复某个软件历史版本的问题,它会下载更新的软件包,查上游补丁,寻找已经修好的代码。

训练要求模型根据指定版本完成修复,直接去网上翻答案,是达不到测试解决问题能力的目的的。

于是团队清理可能泄露答案的文件和缓存,限制网络访问,还专门安排一个Agent去找剩下的漏洞。即便代码通过了测试,还要比较解决方案的质量。

🌟 大方的“分享”

更让同行兴奋的,是罗福莉与团队这次大方的分享。

除了Pro和Flash的RL版本权重、技术报告,小米还宣布开放约7000个训练任务及配套环境、训练框架,以及一个90亿参数模型,供研究者继续开展RL实验。

有点像一家餐厅刚端出招牌菜,把菜谱和同款厨具也交给了同行。

曾在Hugging Face参与模型研发的研究员Elie Bakouch,把这批训练资源的分享称为此次发布中“最疯狂的部分”。

普通用户也有入口。MiMo桌面客户端随新模型发布接入Pro和Flash,可以拿自己的文档、表格和实际任务试试效果。

把工作简单归结为“天才”,省略了太多

2025年11月,罗福莉公开确认加入小米MiMo团队。此前她在阿里达摩院、DeepSeek做过研究,参与过DeepSeek-V2等模型研发。“雷军千万年薪挖人”的传闻,早在2024年底就已传开。

这些故事太好传播了。一个年轻研究员,被大老板慧眼识珠,请去带队攻坚,读起来也痛快。至于她到了新公司怎么做事,大家倒未必有同样的耐心。

今年3月,MiMo以匿名代号上线,被不少人猜成尚未发布的竞品。小米揭晓身份后,仍有开发者回复“营销一流”。

到了这次,小米给外界留下的判断材料充足多了。

💡 她带团队有一套

罗福莉作为团队负责人的风格也逐渐清晰。

她曾推动团队使用Agent,为了让大家真正用起来,提前买好设备、部署环境,让成员在群里一起尝试。

她谈到,MiMo团队不按预训练、后训练划成固定小组,因为有人对两个方向都感兴趣,分得太死会限制成长。项目有实际推动的人,但这个人并不因此拥有对其他成员的绝对控制权。

她甚至提醒,负责人不要有太强的掌控感,觉得“没了我就不行”。

这次谈到把不同任务放在一起训练的MixRL,她讲完技术理由,还半开玩笑提到团队:模型要“混着练”,做不同研究的人也得能凑在一起干活。

带团队做出好模型,需要负责人在合作方式上花心思。罗福莉谈到的这些细节,让人看到她的努力。

把这份工作简单归结为“天才”,实在省略了太多东西。

做出成绩是天赋过人,进展稍慢又怀疑当初吹过了头。在这种讲法里,研究仿佛总该随着某个人的到来立刻发生突破,其他人的工作也很容易被略过去。

当然,小米和罗福莉接下来还有硬仗。一次发布的掌声终有归寂时,模型能否持续进步,开发者是否愿意留下,桌面端能否变成每天都好用的工具,都要靠后续表现来回答。

但罗福莉已经交出了一份不赖的阶段性成果。

真正厉害的人,从不需要“天才”这个词来证明自己。

你觉得,十个月做出这样的成绩,是运气还是实力?欢迎在评论区聊聊。

如果这篇文章让你对罗福莉和小米有了新认识,别忘了点个赞、转给朋友看看。