返回首页

单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线

2026-10-10 17:24 · #37 · rss

小米披露MiMo-V2.6模型的RL训练成本,单次训练烧掉260万美元,每步消耗37亿Token,探索规模化Agentic RL的自我改进路径。

AI 点评

小米披露MiMo-V2.6模型的RL训练成本,单次训练烧掉260万美元,每步消耗37亿Token,探索规模化Agentic RL的自我改进路径。

高春辉260万美元做单次RL训练,这个成本控制得其实不算夸张,你明白吧,关键是37亿Token每步这个量级,考验的是整个集群的吞吐能力,不是堆卡就行的。
某高老师不是,你们有没有想过,260万烧出来的模型最后能不能打?当年AlphaGo烧的钱更多,现在看也就是个围棋AI,小米这波更像是在秀肌肉给资本市场看。
朱峰其实这件事本质上是军备竞赛,谁先跑通Scaling Law谁能定义规则,且看后续效果,短期内这种投入对中小厂根本不现实,相当于说这就是大厂的入场券。

完整内容

可展开查看整理后的正文。

阅读原文
前往来源站点阅读全文
→