腾讯混元把经典临界批大小理论搬进大模型强化学习,PPO生成吞吐最高拉到2.29倍、GRPO省下29%训练时间

大模型强化学习正奔向更大的GPU集群和更厚的训练数据,训练效率已从一个配角升格为头等大事。腾讯混元团队最新研究把目光投向了一个被忽视已久的老问题:当模型自己生成训练数据、且rollout生成与训练本身以不同节奏缩放时,批大小这门手艺该怎么重做。

大模型强化学习正奔向更大的GPU集群和更厚的训练数据,训练效率已从一个配角升格为头等大事。腾讯混元团队最新研究把目光投向了一个被忽视已久的老问题:当模型自己生成训练数据、且rollout生成与训练本身以不同节奏缩放时,批大小这门手艺该怎么重做。

研究从经典的临界批大小理论出发,把它重新推演到在线大语言模型强化学习这个新场景。结论很务实:在GRPO和PPO这两类主流算法里,只要在扩大批大小的有界范围内重新调一调学习率,就能保住"每条响应"该学到的东西不被稀释。也就是说,批大小不是越大越好、也不是一成不变,而是存在一个能调教清楚的甜蜜区间。

落到实打实的硬件账单上,收益相当醒目。在固定硬件配置下,把批大小往上扩,PPO生成阶段的吞吐量最高提升2.29倍;而测量到的最佳GRPO配置,用比此前少29%的时间就跑到了同一个验证目标。对天天烧卡的训练团队来说,这意味着同样一张集群、同样一个目标,要么更快地交卷,要么在单位时间里吞吐更多——强化学习里最贵的那部分生成开销,被悄悄挤出了水分。

这项研究的意义在于,它给在线RL的规模化提供了一把可操作的旋钮:模型在强化学习里既是学生也是出题人,生成与训练两条流水线的缩放失配正是效率黑洞的源头,而临界批大小加学习率重调的组合,恰好补上了这道缝隙。当行业还在比谁的模型更大,腾讯混元先把刀磨向了怎么让已有的卡跑得更划算。

💬 评论
🔗 本文链接

以专业为基,引领科技向善向新

Rooted in professionalism, we lead technology toward social good and innovation.

数智化转型网 · 了解更多产业资讯与选型数据 →

📰 你可能也喜欢

数智化转型网每日AI资讯 AI情报站

微软联手哈佛MIT端出生物学世界模型Project Quine,一个周末筛出抗癌候选物

微软研究院把生物学研究的世界模型这个概念第一次真正落了地。它与哈佛大学、麻省理工学院博德研究所联手推出了一套实验性多模态 AI 研究系统 Project Qui…
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

谷歌宣布向免费用户全面开放 Gemini Skills,Gems 功能将于 11 月完成历史性整合

人工智能个性化工具的体验门槛正在迎来大幅降低。谷歌近日正式对外宣布,决定将此前仅限 Pro 和 Ultra 付费订阅用户使用的Gemini Skills自定义指…
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 国内AI资讯

豆包AI再升级:一站式搞定出行全流程,剑指生活服务入口

9月30日消息,字节跳动旗下AI助手豆包近日迎来功能升级,正式接入机票、火车票预订、打车叫车及地图导航等出行服务,试图从“对话助手”向“生活服务入口”转型。
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 国内AI资讯

Anthropic IPO 文件曝光:向 SpaceX 豪掷 845 亿美元锁定 AI 算力

协议规模翻倍,远超 5 月披露水平
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

OpenAI 携手 ModRetro 发布 Codex 专用插件:动动嘴就能造出复古 Game Boy 游戏

在今日召开的2026开发者日活动中,OpenAI 带来了让人眼前一亮的全新跨界合作。官方宣布携手复古掌机厂商 ModRetro,将旗下的 AI 智能体编码工具 …
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

Anthropic 披露与 SpaceX 签署高达 845 亿美元巨额算力协议

人工智能领域的算力争夺战正在持续加码。根据Anthropic在最新机密 IPO 文件中披露的信息显示,该公司已与SpaceX正式签署了一项规模庞大的算力供应协议…
📅 10-03 · 👁 2026年10月3日