深夜打开小米MiMo训练直播页,跳动的数字让人心惊:一小时3万美元,折合人民币超20万元,36小时烧掉108万美元。这不是融资发布会,是强化学习训练的实时账单,显卡故障、奖励曲线、每一步花了多少钱,全部公开可查。

希鸥网观察到,这场直播的主角是小米大模型团队负责人罗福莉及其MiMo-V2.6系列。沉寂近半年后,她带着Flash和Pro两款模型重新露面,自4月开源MiMo-v2.5以来,团队只研究一件事:强化学习到底能扩展到多远。

烧钱速度只是表象。真正值得拆解的是小米选择的技术路线。传统预训练靠堆数据、堆参数、堆算力,路径清晰。强化学习能否复刻这条曲线,业界一直没有确定答案。小米给出的方案是沿三个维度扩展:训练计算量、环境执行框架、评分计算量。

第一个维度最直观。每个训练Step处理约20亿Token,配置为1568个Prompt乘以每个Prompt 16条Rollout,一轮就可能产生超过2.5万条轨迹。对于Agent任务,一条轨迹往往经历几十轮思考、工具调用和环境反馈,单步Token消耗轻松达到数十亿级别。

供应链层面的压力随之而来。Fully Async完全异步架构让生成、执行、评分、训练四环节不再排队,不同任务同时处于不同阶段。这套系统对算力调度和故障容错的要求极高,直播页面专门展示显卡故障节点,本身就是一种工程透明化的表态。

希鸥网认为,小米把训练过程做成直播,本质上是一次对资本市场的信号释放。2026年大模型竞争进入下半场,开放权重和代码已不新鲜,开放训练过程意味着把烧钱效率摆上台面。谁的单位算力产出更高,谁就能在下一轮融资谈判中占据主动。

这场实验对创业者的启示,藏在李志磊关于AI创业的判断里。选择AI Native还是AI Enabled,决定的不只是技术路线,更是团队基因和估值逻辑。小米做的是从零重构RL循环,属于典型的AI Native打法,适合资源充沛、敢押注长周期的团队。

垂直AI的价值同样值得琢磨。通用模型解决常识问题,垂直AI解决专业判断问题。小米这套评分计算量和信用分配机制,本质上是把Agent执行过程中的隐性经验编码成可训练的信号。这个思路移植到法律、医疗、工业质检等场景,就是垂直玩家的定价权来源。

开源模型的商业化悖论也在这次直播中显现。模型权重免费开放,但支撑起20亿Token单步训练的算力、异步调度框架、评分体系,全是昂贵的配菜。真正的商业机会不在于模型本身,而在于谁能提供企业级的托管、适配和安全加固服务。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo