Episode: MiMo-V2.6发布:46分登顶开源,价格不变
Duration: approximately 8 minutes
Level: 入门
---
[Mike]: 欢迎来到从零开始学AI!先问你一句,一个模型自己跟自己练了半年,最后交卷的那一刻,你觉得最该涨的是什么?
[Sarah]: 答案可能有点反直觉。小米今天正式发布并开源了MiMo-V2.6,智能涨了一大截,价格那一栏一个字都没改。
[Mike]: 老规矩,先讲概念再看新闻。这次官方反复提一个词,RSI,递归自我改进,说白了就是让模型在试错里自己越变越强。
[Sarah]: 怎么自己变强?靠的还是强化学习。老比喻,考试、对答案、再考一遍,分数一点点往上挪。上一期我们带大家看过他们的训练直播间,账单按秒跳,这期直播结束了,成绩单出来了。
[Mike]: MiMo-V2.6有两个版本,Pro和Flash,都是原生全模态,文本、图像、视频、音频都能进。官方说这半年就研究了一件事,把强化学习的算力能堆到多大。
[Sarah]: 先看分数。在Artificial Analysis Intelligence Index,也就是AA综合智能指数上,MiMo-V2.6-Pro拿了46分。
[Mike]: 46分什么概念?它超过了Kimi K3和Qwen3.8 Max,是目前最强的开源模型。
[Sarah]: 但前面还有人。最强的闭源模型Claude Fable 5.1和GPT-6 Astra还在它上面,差距还在。
[Mike]: 再看价格。V2.6沿用V2.5的API定价,智能提升,标价不动。官方给了个说法,同等智能水平下,价格大概是海外模型的1/20到1/60。
[Sarah]: 听起来很爽,但钱烧在哪?毕竟上一期我们算过,直播那会儿一小时约3万美元。
[Mike]: 完整训练历时不到6天,Flash花了约85万美元,Pro约262万美元,各完成30步,累计约75万条轨迹。
[Sarah]: 效果上,训练任务平均通过率相对提升了25%和12%。样本外的长程软件工程评测DeepSWE v1.1,Flash从48.8提到65.7,Pro从58.4提到72.6。
[Mike]: 关键是样本外也涨,说明不是把题库背下来了。
[Sarah]: 钱主要砸在三个方向。第一个是更大批量、更高吞吐,单次更新用1568个样本,支持100万上下文长度,单步训练Token达到3.5~3.7B。
[Mike]: 第二个是更多任务和更复杂环境,代码、通用、视觉、网络安全四类一起练,还混了多套工具链,逼着模型长出通用本事。
[Sarah]: 第三个最有意思,给打分本身加算力。同一道题的多种尝试放一组里互相比较,才能判断长任务里哪一步真正扭转了局面,模型才知道该往哪使劲。
[Mike]: 细节上他们冻结了MoE的Router,防止专家负载乱漂,又建了一整套防线防奖励作弊,训练才稳得住。
[Sarah]: 概念和账都对上了,这次发布还有个新提法,从Vibe Coding到Vibe World,不只写代码了,直接搭世界。
[Mike]: 三个例子。输入图片、视频或文字,多智能体自己拆任务,搭3D场景、写交互逻辑、做视觉验证,还能根据渲染结果改,最后交出一个能玩的游戏世界。
[Sarah]: 还能在Blender里做三维建模,动画、3D打印、游戏素材都能直接用。
[Mike]: 最直观的是具身智能,把多视角相机画面当输入,持续推理决策,指挥一只Franka Panda机械臂抓东西、对颜色、精准放置。
[Sarah]: 电脑操作也升级了,看得懂复杂界面,会用办公软件查资料、改数据,还能看着屏幕反馈自己检查、返工。
[Mike]: 这些能力没专门针对科研训过,但已经能干活了。小米前沿材料团队让它找能吸附PFAS的金属有机框架材料,PFAS就是那种很难降解的永久性污染物。
[Sarah]: 它先翻文献和专利提方案,再调开源计算工具做干实验,算出材料和污染物的结合强度筛一遍,挑最有希望的送去真正的湿实验。
[Mike]: 数学那边更狠,Lean 4里把周期三蕴含混沌这篇经典论文的主定理完整形式化,6000多行源码,全过内核核验,没有留一处未完成的占位。
[Sarah]: 它从没受过Lean的专项训练。这句话的分量在于,复杂形式化证明这件事,它先摸到了门。
[Mike]: 设计和创作上,Design Arena榜单里Pro和Claude Opus 5、GPT-5.6 Sol打得很近,前端、PPT、视频、音乐全都动了。
[Sarah]: 视频能端到端做完整流程,视觉设计、镜头动效、配乐卡点一路排下来,还能调MiMo-V2.5-TTS配旁白。音乐那条更妙,一首约十种乐器的管弦乐,它自己生成乐谱,再转成MIDI。
[Mike]: 最后是开源。模型权重、技术报告全开,还带上了MiMo-V2.6-Distill-Qwen-9B和配套的RL研究资源。
[Sarah]: 里面有7k多个高质量RL任务环境,覆盖软件工程、漏洞复现、知识型工作、网页设计四类。拿那个9B小模型当起点练,11项评测全线超过SFT基线,SWE-bench Verified从61.1提到66.2,终端任务2.1从37.1提到52.8。
[Mike]: 端到端训练框架也开了,基于verl、uni-agent和mini-swe-agent,从环境交互到策略优化一整套。还有一组极简harness,系统提示、工具、上下文管理是拆开的,谁都能自由组合。
[Sarah]: 用法上,MiMo Desktop同步上线,订阅会员或者配自己的API Key都行,Pro和Flash都给了UltraSpeed,最高20倍推理速度。对了,调接口时模型名记得全小写。
[Mike]: 说到这我还惦记着上一期那个账单。6天烧掉的钱,换回来的其实不只是两个模型。
[Sarah]: 开源清单里那7k多个训练环境,就是当初练出它们的考场。
[Mike]: 也就是说,这次交出来的不只是成绩单,连出题和判卷的那套东西也一起开了,谁想接着往下练,门是敞着的。
[Sarah]: 官方在技术报告里引了一句古文,夫夷以近,则游者众;险以远,则至者少。在一个智能容易被复制的时代,他们把算力投进真实环境,让模型在反馈里一次次试错。
[Mike]: 走的人多的路好走,但风景是别人的。感谢收听从零开始学AI,把这期转给那个总问AI会不会取代他的朋友吧,我们下期见!
[Sarah]: 下期见!
