小米MiMo-V2.6炼丹直播收官:6天花2344万,Pro登顶开源榜首据官方消息,9 月 22 日,小米把这轮大模型强化学习(RL)训练搬进了直播间,跑满 6 天、烧掉 350 万美元(约合人民币 2344 万元),最终把 MiMo-V2.6 的 Pro 和 Flash 双双跑完 30 个训练 Step。结果也很硬:MiMo-V2.6-Pro 在 Artificial Analysis 智能指数上拿到 46 分,登上全球开源模型第一名。 小米 MiMo 负责人罗福莉称,这是「迄今为止任何开源模型团队所进行的规模最大的单次强化学习训练之一」,并直言其背后的研究与工程挑战,超过了她曾参与其中的 DeepSeek-R1。 花了两千多万,模型强在哪据官方披露,Pro 用时 5 天 3 小时、花费约 260 万美元;Flash 用时 3 天 10 小时、约 90 万美元。每个 Step 含 1568 个 Prompt,每题让模型尝试 16 条路线,一轮就产生超 2.5 万条轨迹。 练完 30 步,Flash 的平均通过率相对提升 25%,Pro 相对提升 12%。更能说明问题的是样本外成绩:在考察编程 Agent 真实能力的 DeepSWE v1.1 上,Pro 从 58.4 分涨到 72.57 分,Flash 从 48.7 分涨到 65.68 分。部分 Agent 评测里,Pro 已经和头部闭源模型打平甚至反超——AutomationBench 上 Pro 拿到 53.1 分,高于 Claude Opus 5 的 50.3 分和 GPT-5.6 Sol 的 45.8 分。 能力强了,价格没涨据了解,MiMo-V2.6 沿用上一代定价,Pro 输入/输出约每百万 Token 3 元/6 元,Flash 约 1 元/2 元。按 Artificial Analysis 测算,Pro 完成一项指数任务平均成本仅约 0.13 美元;而同为 46 分的 Grok 4.7,完成同样任务平均要约 3.74 美元,相差约 29 倍。 小米这次还一口气开源了模型权重、完整技术报告、7000 多个 RL 任务环境、端到端训练框架,以及可自由组合的 mini-harnesses——模型、训练场、裁判、流水线基本配齐。 不只写代码,还能设计材料据官方介绍,MiMo-V2.6-Pro 还被直接扔进科研场景设计新型 MOF 材料(用来吸附「永久性污染物」PFAS),没有做过一天专项训练,却给出了两个候选结构,吸附性能达到对照材料的百万到千万倍。北京大学材料学院特聘研究员窦金虎评价,其表现相当于一个训练有素的博士研究员。小米方面称,内部新材料研发周期已从一个月压缩到 2 到 3 天。 从写代码到 3D 建模、视频、音乐,再到控制机械臂,MiMo-V2.6 这一代把能力从「Vibe Coding」扩到了「Vibe World」。 来源:量子位《6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官》 原文链接:https://www.qbitai.com/2026/09/494179.html |
业界动态苹果的隐私高墙,被 Meta AI 助手借道绕过2026-10-09
业界动态《怪物史莱克》编剧也来了:这家影视公司做2026-10-08
业界动态Manus 回来了:2.0 上线自研框架 Cascade,2026-10-07