单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线
小米披露MiMo-V2.6模型的RL训练成本,单次训练烧掉260万美元,每步消耗37亿Token,探索规模化Agentic RL的自我改进路径。
AI 点评
小米披露MiMo-V2.6模型的RL训练成本,单次训练烧掉260万美元,每步消耗37亿Token,探索规模化Agentic RL的自我改进路径。
高春辉260万美元做单次RL训练,这个成本控制得其实不算夸张,你明白吧,关键是37亿Token每步这个量级,考验的是整个集群的吞吐能力,不是堆卡就行的。
某高老师不是,你们有没有想过,260万烧出来的模型最后能不能打?当年AlphaGo烧的钱更多,现在看也就是个围棋AI,小米这波更像是在秀肌肉给资本市场看。
朱峰其实这件事本质上是军备竞赛,谁先跑通Scaling Law谁能定义规则,且看后续效果,短期内这种投入对中小厂根本不现实,相当于说这就是大厂的入场券。
完整内容
可展开查看整理后的正文。
前往来源站点阅读全文 →