MiMo-V2.6 系列包含 Pro 和 Flash 两个原生全模态模型。得益于 RL 算力的扩展,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前最强的开源模型;但与最强的闭源模型 Claude Fable 5.1 和 GPT-6 Astra 相比,仍有差距。
MiMo-V2.6 系列 沿用 V2.5 系列的 API 定价。智能提升,价格不变,“智能-成本”的帕累托前沿由此再度向外推进。MiMo-V2.6-Pro 刷新了国产模型的性价比纪录:在同等智能水平下,价格仅为海外模型的 1/20 至 1/60。
MiMo-V2.6 的一个重点是进一步增加强化学习阶段的算力投入。
小米表示,V2.6 的 Live RL 训练持续不到 6 天,Flash 与 Pro 分别完成 30 步训练,累计约 75 万条轨迹,训练成本分别约为 85 万美元和 262 万美元。
训练主要从三个方面扩展:
更大的 Batch 与更高吞吐:单次更新使用 1,568 个样本,支持 1M 上下文长度训练,单步训练 Token 达到 3.5~3.7B。
更多任务和复杂环境:训练覆盖 Code、General、Visual、Cyber 等方向,并混合多个 Harness。
增加 Grader 算力:通过相对比较为长程强化学习任务提供奖励信号,引导模型使用更短路径和更少 Token 完成任务。
按照小米公布的测试结果,MiMo-V2.6-Flash 与 Pro 在样本外长程软件工程评测 DeepSWE v1.1 上分别由 48.8 提升至 65.7、58.4 提升至 72.6。
MiMo-V2.6 进一步融合了 3D 空间推理、多模态感知和 Computer Use(CUA) 能力,小米将这种从编程扩展到交互世界构建的方向称为 Vibe World。
例如在 3D 游戏开发中,用户可以输入图片、视频或者文字需求,模型将任务拆解后通过多智能体协作完成 3D 场景搭建、交互逻辑编写和视觉验证,并根据渲染结果继续调整。
MiMo-V2.6 还可以根据文字或参考图片操作 Blender 完成物体及场景的三维建模。
在具身智能实验中,模型则能够使用多视角相机画面进行持续推理,通过视觉反馈控制 Franka Panda 机械臂完成抓取、颜色匹配和物体放置。
Computer Use 也是 MiMo-V2.6 重点展示的能力之一。
模型可以理解复杂的图形界面,并操作常见的办公和生产力工具,完成信息检索、内容编辑和数据处理等任务。
与简单执行固定操作不同,MiMo-V2.6 可以根据界面的视觉反馈检查执行结果、发现问题,并进一步调整后续操作。
这意味着 MiMo 正在进一步向能够实际操作电脑完成长程任务的 Agent 方向发展。
MiMo-V2.6 也加强了代码驱动的内容创作能力。
模型可以根据指令生成完整的前端页面和 PPT,同时调用 Figma 以及图像、视频生成工具制作相关视觉素材。
视频方面,官方展示了从视觉设计、镜头和动效编排,到配乐、节奏处理以及 TTS 旁白生成的完整工作流。
音乐方面,MiMo-V2.6-Pro 还展示了 Demo 级音乐创作能力。官方案例中,模型根据要求完成了一首包含约十种乐器的管弦乐作品,并在生成乐谱之后自主转换为 MIDI。
小米还展示了 MiMo-V2.6-Pro 在科研任务中的实验。
在材料研究案例中,模型协助研究人员设计用于吸附 PFAS 的金属有机框架(MOF)材料,包括检索文献和专利、提出研究假设,以及调用开源计算工具进行模拟筛选。
另一个案例则是形式化数学证明。
在研究人员设计的探索策略下,MiMo-V2.6-Pro 通过 Sub-Agent 协作,在 Lean 4 中完成 Li–Yorke 经典论文《周期三蕴含混沌》原始主定理的形式化,最终项目包含 6000 余行 Lean 源码,并通过 Lean 内核核验。
值得注意的是,小米表示模型此前并没有接受针对 Lean 的专项后训练。
伴随 V2.6 发布,Xiaomi MiMo Desktop 桌面客户端及会员订阅方案同步上线。
目前 Desktop 预置:
MiMo-V2.6-Pro、MiMo-V2.6-Flash 和 MiMo-V2.6-Pro-UltraSpeed。
其中 UltraSpeed 是值得关注的新模式,在保持 V2.6-Pro 能力的同时,官方称其可提供最高 20 倍推理速度,主要面向实时交互和对响应速度要求较高的场景。
用户也可以在 MiMo Desktop 中配置自己的 API Key 使用模型。
这次小米同时宣布全面开源 MiMo-V2.6-Pro 和 Flash 的模型权重及技术报告。
此外还开放了 MiMo-V2.6-Distill-Qwen-9B 以及相关强化学习研究资源,包括:
7,000+ 高质量 RL 任务环境
端到端 RL 训练框架
轻量可组合 mini-harnesses
任务环境覆盖软件工程、漏洞复现、知识型工作和网页设计开发等智能体任务。
相比单纯开放模型权重,这次小米还把部分训练环境、RL 代码和 Harness 一并开放,更方便开发者和研究人员研究 Agentic RL 和模型自我改进。
有兴趣的可以体验,新用户通过邀请码注册可得体验金:
