留言

每秒烧10美元,小米把两个模型训练过程直播了

每秒至少烧掉10美元,小米把两个模型的训练过程直接摆到了直播镜头前。这不是发布会上的PPT演示,而是一场正在进行中的后训练直播——屏幕上滚动的是实时训练指标,不是事后总结。 更值得琢磨的是,同时开训的是两个模型: mimo-v2.6-pro 和 mimo-v2.6-flash 。从直播画面看,训练已经进入后训练阶段,标注里写着RL。而衡量训练效果的测试集是DeepSWE,这个选择本身就透露了方向——它练的是Agent能力,不是单纯的对话或答题。 两个模型,一个早期分数 目前mimo-v2.6-pro在DeepSWE上的得分是 62 。作为参照,头部模型比如DeepSeek-v4.1-flash的分数是 74.2 。从训练时间和得分来看,这轮训练还处在相对早期的阶段,离收敛还有距离。 但真正让围观者开始算账的,是那个烧钱速度:每秒至少10美元。这个数字不是随口说的,直播里有一组可以推算的指标。 58分钟,22亿token 看阶段10的数据:生成/推理耗时(timing_s/outer_gen)花了 58分钟 ,这个阶段生成了 22亿 token。简单换算下来,每秒要生成约 63万 token。 再看上下文长度,阶段10的平均上下文(ctx_total_length/mean)是 89K 。这么长的上下文,吞吐通常会明显下降。按H100来估算,单卡吞吐在100-150tps左右的话: pro模型用于解码,大概需要 4000-5000张 H100 flash模型算下来大概是 2000-2500张 H100 预估总卡量在 6000-8000张 左右 还有一个细节能佐证这个推算。生成/推理耗时58分钟,反向传播计算耗时(timing_s/trainer_ops)是 64分钟 ,两者相加正好约等于单步总耗时(timing_s/step)的 126分钟 。这说明推理和反向传播用的是同一批卡——集群先花58分钟全力做Rollout推理,等22.2亿token吐完、环境打分完毕后,这批GPU立刻切换角色,花64分钟全力做分布式长序列的反向传播和梯度更新。既然卡是复用的,用Rollout解码推测出来的卡量,应该就是全量规模。 6万个沙箱在同时跑代码 训练的是Agent能力,这一点在环境数据里体现得更直接。直播画面显示,Pro维持着 23,180个 活跃沙箱,Flash维持着 37,786个 活跃沙箱。加起来,同时有超过 60,000个 真实的Linux/Docker沙箱在并发执行代码和终端命令。 这个规模解释了为什么烧钱速度是每秒10美元。Agentic RL不是让模型做选择题,而是让它在真实环境里执行、试错、拿反馈,每一步都要消耗算力。6万个沙箱同时运转,背后是实打实的计算资源在支撑。 从直播透露的信息看,这轮训练还处在早期,分数和头部模型之间还有明显差距。但把训练过程本身公开直播,并且让围观者能顺着指标一路推算卡量和成本,这个动作在模型厂商里并不常见。至于后续还有哪些数据,直播里留了一句“一会给大家带来更详细的解读”。 特别

about image
穆帅敲打维尼修斯,连续3场将其换下;维尼修斯在与姆巴佩的竞争中,已落下风! 法尔克:拜仁希望在冬窗出售博伊,但目前并没有具体的买家