小米 · MiMo-V2.6 · 强化学习

每小时烧钱 20 万的训练直播,想回答什么

沉默半年的小米 MiMo 团队,把强化学习训练做成了 24 小时直播——账单、跑分、翻车现场,全部摊开

2026-09-19强化学习 · 深度科普约 15 分钟

00引言:一场没有新产品的"发布会"

一段文字,一个链接。账单每小时涨 3.1 万美元。

9 月 17 日凌晨,小米 MiMo 大模型团队负责人罗福莉发了一条动态。

没有发布会,没有新模型,连一张海报都没有。一段文字,一个链接。

文字的核心只有一句:"沉默近半年,我们一直在用这段时间研究一个问题:强化学习(RL)到底可以走多远。"

链接指向 mimo.xiaomi.com/rl。点开,是大模型训练的实时直播:两条训练线正在跑,账单在跳。每一步消耗多少 token、花掉多少美元、通过率爬到多少,全部摊开给所有人看。

到 17 日下午,账单上的数字是 135 万美元。到 19 日我写这篇文章时,已经爬到 280 万美元。折算下来,每小时约 3.1 万美元,人民币 20 多万。

一个模型还没发布的团队,先把训练的账单挂上了网。

这事为什么值得专门写一篇?因为媒体标题都在算那笔钱,但真正值钱的不是钱。是这次公开里那套正在跑的东西:每步 20 亿 token 的强化学习、一道题做 16 遍的采样策略、给"批改作业"单独配的算力。这些是接下来几年大模型进化的主战场,而且不容易过时。

这篇文章顺着那条线走:罗福莉是谁,这半年沉默背后是什么;直播页面上能看到什么,数字怎么读;这些数字背后的原理——强化学习到底在干什么,为什么批改作业也要烧算力;最后,把训练过程公开这件事,在行业里意味着什么。

01沉默半年的人是谁,为什么她一条动态有分量?

从 DeepSeek 到小米,从热搜传闻到朋友圈官宣。

要看懂这场直播,先得看懂发动态的人。

罗福莉,1995 年生,四川宜宾人。本科读北京师范大学计算机专业,硕士在北京大学计算语言学研究所。2019 年,还是学生的她在 NLP 顶会 ACL 上发了 8 篇论文,其中 2 篇一作。这个产出量,很多研究者一辈子也摸不到。

毕业进阿里达摩院,主导多语言预训练模型 VECO,推动了 AliceMind 的开源。2022 年加入幻方量化,后来成为 DeepSeek 的深度学习研究员,参与研发 DeepSeek-V2——正是那一代模型,把"低价高性能"刻进了行业的记忆。圈子里叫她"AI 才女"。

2025 年初,一条传闻上了热搜:雷军想用千万元年薪把她挖到小米,带队做大模型。传闻满天飞的时候,她本人还在犹豫。当年 11 月 12 日,她在朋友圈官宣:"智能终将从语言迈向物理世界。我正在 Xiaomi MiMo,和一群富有创造力、才华横溢且真诚热爱的研究员,致力于构建这样的未来,全力奔赴我们心目中的 AGI。"

MiMo 是小米的自研大模型系列,她就是负责人。2026 年 3 月,小米连发三款模型:MiMo-V2-Pro、V2-Omni、V2-TTS。雷军专门发了微博:万亿参数的 V2-Pro 在 Artificial Analysis 全球综合智能榜上排第八,按品牌排第五,超过了 xAI Grok。4 月,V2.5 开源。5 月底,V2.5 系列 API 永久降价,最高降幅 99%。

然后,安静了。

从 4 月开源 V2.5 到 9 月,将近半年,MiMo 几乎没有声音。外面的解读开始走偏:小米 AI 是不是掉队了?是不是又起了大厂做基础研究的通病,热闹一阵就散?

9 月 17 日凌晨的动态给出了答案。没有掉队,团队把这半年全押在了一个问题上:强化学习能扩展到多远。直播页面显示两条训练线 9 月 15 日就开跑了。也就是说,答案不是临时拿出来的,是攒了半年,攒到觉得能见人的时候,才把窗帘拉开。

02直播间里有什么,普通人能看懂什么?

两条训练线,一张实时账单,一条一直在滚的日志流。

先说清楚这个页面在直播什么。

MiMo-V2.6 还没发布。现在跑的步骤叫"强化学习后训练"——预训练早就结束,模型已经读完了海量文本,现在是把它送进训练场:反复做题、调用工具、接受评分。直播的是这个"做题"阶段。

页面顶部是公告栏(notices),往下是两条训练线的卡片:MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。Pro 是旗舰,Flash 是轻量版。两条线 9 月 15 日先后开跑,每张卡片上的数字实时刷新。

截至 9 月 19 日MiMo-V2.6-ProMiMo-V2.6-Flash
状态训练中 · 第 24 步已停止 · 第 30 步
累计时长3 天 23 小时3 天 11 小时
累计成本$1,969,773$854,044
总 Token 消耗560 亿814 亿
已训练样本60.2 万条75.3 万条
单步 Token约 29.7 亿约 37 亿
综合通过率0.596(起步 0.564)0.644(起步 0.514)

两条线合计,烧掉超过 280 万美元。每小时约 3.1 万美元——Pro 线约 2 万,Flash 线约 1 万。

再往下是 Benchmark 板块,跑分在爬。DeepSWE v1.1 这个测试要求模型进入真实代码仓库,定位并修复问题,Flash 的分数从 48.67 爬到 64.90,Pro 到了 68.05。四天,16 分的提升。此外还有内部编码测试和自动化测试两组分数,都在 50 到 65 分之间。

页面上最"活"的部分,是动态采样器的日志流。每隔一分钟滚出一行:accepted 2,216/1,568 · judged 2,142 · pass 0.635。盯着看十分钟,它会一直跳——采样器源源不断地给训练喂题,喂进去的题被批改、被筛选,合格的送进训练步。像看一条永不停歇的流水线传送带。

还有一个容易被忽略的细节:任务构成。第 24 步的 1,568 个任务里,代码类占 67.7%,视觉类 17.2%,通用类 12%,对话类 3%,来自 25 个数据源。这是一场以代码为主、多任务混合的强化学习。

读账单的方法:训练页面的成本数字是"这一条线从开跑到现在"的累计值,不是这一代模型的总投入。预训练的钱、基建的钱、人力的钱,都不在这张账单上。280 万美元只是强化学习这一个阶段的门票钱。

普通人看到这里,最直观的感受就一个字:贵。一小时 20 万,一天 75 万。这是"钞能力直播"这个说法的由来,媒体的标题全在算这笔账。

但钱只是门票。真正有意思的,是钱买来的东西,和这些数字背后的原理。

03同一道题,为什么让模型做 16 遍?

强化学习的全部秘密,藏在"1568 × 16"这道乘法里。

现在回答那个核心问题:强化学习,到底在干什么?

预训练和强化学习,是养一个大模型的两个阶段,方式完全不同。

预训练像读书。把互联网上万亿 token 的文本喂给模型,让它学会"预测下一个词"。这一步教会它语言、知识、推理的底子。但读书读出来的本事是"知道",不一定是"做到"。

强化学习像刷题。给模型出题,让它做,做完了批改,做对了给奖励,做错了不给。模型朝着"多得奖励"的方向调整自己。数学、写代码、用浏览器、调工具——这些"动手"的能力,主要靠这个阶段练出来。

罗福莉页面上的数字,对应到刷题是这样的:

一步训练,出 1,568 道题。每道题,让模型独立做 16 遍。16 份答卷,全部收上来。

为什么做 16 遍?因为模型每次的解法可能不一样。同一道题,第一遍用了个笨办法,磨了很久做对了;第二遍找到了巧办法,几步搞定;第三遍干脆做错了。这些差异本身就是信号——强化学习要做的,就是从差异里判断:哪种做法值得奖励。

1,568 × 16 = 25,088 条解题轨迹,每一步都是这个量级。而且"完全异步"——25,088 份卷子不在一张桌子上等齐了再批,谁做完谁先交,先交的先批。这是工程上的取舍:同步就得等最慢的那份,快的算力全闲着;异步流起来,机器不空转。

一步吃掉约 20 亿 token。这个数字的意思是:25,088 条轨迹里,模型读题、思考、调用工具、写过程、被批改,全部加起来的文本量。一步 20 亿,几十步下来,就是上千亿 token 的吞吐。

还有个容易忽略的词:沙箱。模型做题不是在纸上写答案,是真的在一个隔离环境里跑——写代码就真的执行,调工具就真的调用。据页面数据,两条线累计调用沙箱环境 800 多万次。它会真的把代码跑崩,真的报错,真的重试。摔打出来的本事,才是真本事。

这套逻辑串起来,强化学习的"学习"就清楚了:做题 → 批改 → 比较 16 份答卷 → 判断哪种做法得奖励 → 调整 → 下一批题。循环,循环,循环。

这也解释了为什么综合通过率能从 0.514 爬到 0.644:不是模型换了,是它在一个一个训练步里,被 25,088 份答卷的对比信号反复掰正。

04批改作业,为什么也要烧算力?

Grader Compute:这次公开里技术含量最高的一个词。

罗福莉说的三方面扩展,第三项最值得单独讲:Grader Compute,评估计算。

前两项好理解。计算资源,就是上面说的每步 20 亿 token;环境和测试框架,就是沙箱和多任务混合。第三项——给"打分"这件事本身配算力——是这次公开里技术含量最高的部分。

为什么打分还要算力?

传统强化学习的奖励是简单的。下棋,赢了 +1,输了 -1,游戏结束分数现成。信号干净,计算便宜。

但 Agent 任务不是棋局。"让模型修复一个代码仓库里的 bug",怎么判断它修好了、修得好不好?这题没有标准答案可翻。

小米的做法,对应罗福莉提到的那串术语:Agentic In-group Credit Assignment,代理式组内信用分配。拆开看。

先说"组内"。一道题 16 份答卷,就是一个组。信用分配在组内做:这 16 份卷子放在一起比,谁的解法值得奖励?都做对了,哪个做法更漂亮?一个做对一个做错,差在哪一步?奖励信号从组内的相对比较里来。这比"做对 +1"细得多——它比较的是做法,不只是结果。

再说打分本身。代码任务,用测试用例判:跑一遍测试,全过算过。这要算力——测试要真的执行。更复杂的任务,用"量规"(rubric)判:不是非黑即白,而是按维度打分——任务完成度、过程合理性、有没有多余的破坏性操作。量规评判往往还要一个模型来当评委。评委也要算力。

这就是 Grader Compute 这个词的分量:在 Agent 时代的强化学习里,批改作业的算力,和做题的算力,是同一个量级的东西。

页面上能直接看到这笔账的痕迹。动态采样器的日志里,"judged"这个数字一直在跳——每一分钟都有上千条轨迹被批改。公告栏里还有一条:训练集群和评测部署之间出现网络连接问题,导致重启。批改系统和做题系统是两套独立部署的集群,中间靠网络连着。哪边断,训练都得停。

打个比方。以前训练模型像自学刷题册,答案印在书后面,翻页对答案就行。现在的 Agent 强化学习像带私教的特训——私教盯着你每一步操作,现场出题、现场判卷、现场比较你的 16 种解法,还要现场写评语。私教的时薪,不比学生便宜。

05公告栏里的 11 次重启,为什么反而值得公开?

训练不是丝滑的。凌晨四点的公告最真实。

直播页面还有一个板块,媒体报道得少,但可能是最"真实"的部分:公告栏。按时间念一遍。

9 月 17 日凌晨 4 点:Pro 线因某节点显存问题重启。

当天上午 10 点:Flash 线从第 15 步重跑。原因:一类基础设施错误,过去约 3 小时没有被正确检测出来。

当晚 8 点:Pro 线训练集群与评测部署之间出现网络连接问题,再次重启。同时做了个决定:把 cyber 数据集从下一次运行中移除——因为轨迹日志里出现了一些坏模式。翻译一下:喂进去的题里有一批质量有问题,模型练了会练歪,直接下架。

9 月 18 日:Pro 线在第 17 步因 GPU 显存溢出重启,诱因是专家负载不均衡,团队调整了并行策略。

到 18 日上午,两条线累计重启 11 次,Pro 占 9 次。19 日最新的公告是另一类操作:过滤掉对当前 Pro 模型"太简单"的任务——模型变强了,小学题刷了没意义,换难题。

这些公告,正常公司的公关部门是不会让挂出去的。训练崩了、数据脏了、错误三小时没发现——哪一条单独拎出来,都够写一篇"小米大模型训练事故"。

但换个角度看,这才是大规模强化学习的真相。

几百张卡连起来跑几十小时,显存溢出是常态,网络抖动是常态,数据里有脏东西是常态。公告栏里每一次重启,背后大概率都有工程师在凌晨爬起来看日志、改配置、按下重启键。直播把"踩坑"也播了出来——不遮掩的翻车,比精修的跑分可信得多。

对同行,这是坦诚。对观察者,这是稀有的一手材料。以前我们从论文里读强化学习训练,一切平滑、一切收敛;现在我们知道,真实的训练页面长什么样,真实的故障频率是什么量级。

顺带说一句,"过滤太简单的任务"这条公告还有另一层意思:它在动态地挑题。模型强了,题目难度跟着涨,算力花在刀刃上。这个细节在页面上叫 dynamic sampler,动态采样器——它不只是个直播素材,是这次训练方法的核心部件。

06从黑箱到玻璃箱,这场直播改变了什么?

透明本身,成了模型竞赛的新赛道。

把视角拉远,看这件事在行业里的位置。

大模型训练,从 ChatGPT 火起来那天起,就是全球最大的黑箱之一。外界能看到的只有两头:进去的是几万张卡和海量数据,出来的是一个模型和一份技术报告。中间发生了什么、烧了多少钱、崩了几次、哪些尝试失败了——全部保密。竞品在赌,观察者在猜。

mimo.xiaomi.com/rl 把中间那一段摊开了。费率(每小时 3.1 万美元)、步数、token 消耗、重启次数、坏数据集下架——这些以前只存在于内部仪表盘上的数字,现在任何人都能实时看到。

这里要划清一个边界:直播不等于开源。罗福莉说得很清楚,团队会在接下来几周内"逐步开源相关细节"——开源的是这次强化学习训练的过程和方法,MiMo-V2.6 模型本身还没有发布信息。账单透明和技术开源,是两件事,前者先走了一步。

但账单透明这件事本身,已经足够新。当一条训练线的成本、进度、故障可以被外部实时核查,模型竞赛就多了一个维度:不只比谁的分数高,还比谁的过程可信。对 API 客户、对开源社区、对想复现的研究者,这个维度的价值是实打实的。

再往深一层,这场直播回应的其实是全行业的问题。

预训练的 scaling,撞墙感越来越强——高质量语料快用完了,堆参数的边际收益在降。下一波能力增长从哪来?2025 年 DeepSeek-R1 把强化学习推上牌桌,OpenAI 的 o 系列一路押注,答案越来越集中:RL。让模型在可验证的任务里反复做题、自我改进,是当前最确定的第二条增长曲线。

小米押的也是这条。罗福莉今年 3 月在一个圆桌上说过,接下来一年 AGI 进程里最关键的事是"自进化"——模型在可验证的约束下持续迭代优化,自主学习。她当时预测,一到两年内,大模型叠加自进化框架,会给科学研究带来指数级加速。MiMo-V2.6 这次训练,就是朝这个方向走的一步:多任务混合、真实沙箱、组内信用分配,全是"让模型自己变强"的基础设施。

钱的事也顺便说清。雷军今年给 AI 的预算是至少 160 亿元,未来三年 600 亿。这场直播每天烧掉约 75 万美元——看着吓人,放进 160 亿的盘子里,是零头。真正贵的是方向错了的沉没成本。直播至少让外界看到:钱花在了行业共识的方向上,且过程有据可查。

视角以前这次直播之后
训练成本猜,或者等财报里的研发费用实时账单,每小时可核查
训练过程黑箱,只有成品和技术报告步数、token、样本量全程可见
故障与踩坑永远不会出现在任何对外材料里公告栏实时播报,含重启原因
能力增长发布时跳一个总分通过率曲线,一步一步爬

07收尾:这笔钱烧得值不值?

曲线还在爬坡。没人知道顶在哪。

回到罗福莉那句开场:强化学习到底能走多远?

直播页面给出的阶段性答案是曲线。Flash 的综合通过率从 0.514 爬到 0.644,DeepSWE 从 48.67 爬到 64.90——四天,16 分。Pro 线才跑到第 24 步,曲线还在爬,没人知道顶在哪。

280 万美元买来了什么?买来了一个还在增长的能力曲线,和一套被公开检验过的训练方法。等几周后细节开源,同行可以自己判断这套方法的成色。

每小时 20 万的账单还在跳。页面还开着,任何人都可以去盯着那条曲线,看它什么时候停下来——或者,不停。