小米公开MiMo-V2.6大模型RL训练过程 罗福莉发文确认将开源技术细节

9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文,首次公开旗下最新大模型MiMo-V2.6的强化学习(RL)训练进展,并同步上线实时训练页面,开启大模型RL阶段的全程公开直播。此举标志着小米在物理世界与通用智能(AGI)道路上的探索迈入全新突破期,相关技术细节亦计划于未来数周内逐步开源。

9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文,首次公开旗下最新大模型MiMo-V2.6的强化学习(RL)训练进展,并同步上线实时训练页面,开启大模型RL阶段的全程公开直播。此举标志着小米在物理世界与通用智能(AGI)道路上的探索迈入全新突破期,相关技术细节亦计划于未来数周内逐步开源。

技术架构上,MiMo-V2.6正在开展大规模多任务智能体(Agent)RL实验。团队围绕三大维度进行全面扩展:算力层面实现单步约20亿Token(1568个Prompt×16次rollout)的完全异步并行;环境层面搭建支持单次运行混合多框架的代理式RL;评估层面则采用带测试用例与量规奖励的组内信用分配机制。

直播页面实时呈现训练进度、Token消耗与成本指标,其中MiMo-V2.6-Pro版本训练约1天19小时、耗资89万美元,MiMo-V2.6-Flash时长1天14小时、耗资39.7万美元,双版本累计训练成本已突破128万美元。

作为雷军此前从DeepSeek重磅引进的“95后”AI科学家,罗福莉曾主导达摩院多语言预训练及DeepSeek-V2研发,于去年11月正式加盟小米并执掌MiMo大模型团队。今年3月,上一代万亿参数模型Mimo-V2-Pro已登顶Artificial Analysis全球大模型综合智能榜第八位(品牌榜第五)。

本次MiMo-V2.6通过透明化直播与工程细节开源,展示了小米在RL Scaling Law(强化学习扩展定律)上的深度积累,也将推动前沿大模型训练从“黑盒试错”向“极客级过程开源”的范式演进。

💬 评论
🔗 本文链接

以专业为基,引领科技向善向新

Rooted in professionalism, we lead technology toward social good and innovation.

数智化转型网 · 了解更多产业资讯与选型数据 →

📰 你可能也喜欢

数智化转型网每日AI资讯 AI情报站

微软联手哈佛MIT端出生物学世界模型Project Quine,一个周末筛出抗癌候选物

微软研究院把生物学研究的世界模型这个概念第一次真正落了地。它与哈佛大学、麻省理工学院博德研究所联手推出了一套实验性多模态 AI 研究系统 Project Qui…
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

谷歌宣布向免费用户全面开放 Gemini Skills,Gems 功能将于 11 月完成历史性整合

人工智能个性化工具的体验门槛正在迎来大幅降低。谷歌近日正式对外宣布,决定将此前仅限 Pro 和 Ultra 付费订阅用户使用的Gemini Skills自定义指…
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 国内AI资讯

豆包AI再升级:一站式搞定出行全流程,剑指生活服务入口

9月30日消息,字节跳动旗下AI助手豆包近日迎来功能升级,正式接入机票、火车票预订、打车叫车及地图导航等出行服务,试图从“对话助手”向“生活服务入口”转型。
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 国内AI资讯

Anthropic IPO 文件曝光:向 SpaceX 豪掷 845 亿美元锁定 AI 算力

协议规模翻倍,远超 5 月披露水平
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

OpenAI 携手 ModRetro 发布 Codex 专用插件:动动嘴就能造出复古 Game Boy 游戏

在今日召开的2026开发者日活动中,OpenAI 带来了让人眼前一亮的全新跨界合作。官方宣布携手复古掌机厂商 ModRetro,将旗下的 AI 智能体编码工具 …
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

Anthropic 披露与 SpaceX 签署高达 845 亿美元巨额算力协议

人工智能领域的算力争夺战正在持续加码。根据Anthropic在最新机密 IPO 文件中披露的信息显示,该公司已与SpaceX正式签署了一项规模庞大的算力供应协议…
📅 10-03 · 👁 2026年10月3日