每日人工智能资讯|英伟达推出开源 AI 框架 Polar，Codex 性能提升近 600%-数智化转型网

英伟达研究团队近日发布了一个全新的开源 AI 框架 ——Polar。该框架旨在帮助现有的智能体框架（如 Codex、Claude Code、Qwen Code）接入一种名为广义相对策略优化（GRPO）的训练方法，而不影响其原有的工具调用、上下文组织和补丁提交方式。这一创新将大大提升代码智能体的表现。

GRPO 是一种针对强化学习的优化技术，它通过奖励信号来调整模型策略，帮助模型在多步决策任务中学习到更优的行为。在这项研究中，GRPO 主要用于代码智能体的训练，旨在让模型在实际的工具调用和补丁提交流程中不断改进表现。数智化转型网www.szhzxw.cn

研究表明，智能体的强化学习正在逐步从单步任务转向更复杂的长流程任务，例如代码仓库的、浏览器操作以及操作系统的交互。这类任务往往依赖于现有的执行框架，涉及多轮调用、工具使用以及上下文管理等，因此直接将这些框架改写为传统的强化学习环境接口非常困难，可能导致关键训练信号的丢失。

英伟达的 Polar 框架并不试图重写智能体框架，而是通过在模型 API 的边界处放置智能体，保持原有运行逻辑不变。Polar 在执行框架与推理服务器之间了模型智能体，兼容多种请求风格，能够记录关键数据并将其转化为可用于训练的信息。数智化转型网www.szhzxw.cn

从系统架构来看，Polar 包括了任务提交、会话调度和状态持久化等功能，通过优化初始化、运行和后处理的流程，显著提升了训练效率。根据实验结果，使用 Polar 与 GRPO 训练的智能体在 SWE-Bench Verified 测试中的性能大幅提升，Codex 的 pass@1 分数从 3.8% 提升至 26.4%，增长幅度达 594.74%。

此外，该框架在提高效率方面也表现出色，训练时间减少了约 5.39 倍，GPU 的平均利用率也显著提升，为未来的智能体训练提供了更强大的支持。数智化转型网www.szhzxw.cn

若您对人工智能感兴趣或为人工智能创始人，可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商，可联系数智化转型网小助手思思（17757154048，微信同号）

若您为人工智能服务商，可添加数智化转型网小助手Jasper，加入人工智能行业交流群。

声明：本文来自数智化转型网，版权归作者所有。文章内容仅代表作者独立观点，不代表数智化转型网立场，转载目的在于传递更多信息。如有侵权，请联系我们。

本文由数智化转型网（www.szhzxw.cn）转载，编辑/翻译：数智化转型网（Professionalism Achieves Leadership 专业造就领导者）白龙

每日人工智能资讯|英伟达推出开源 AI 框架 Polar，Codex 性能提升近 600%

《福建省人民政府节约能源办公室关于进一步推进全省能耗总量和强度“双控”工作七条措施的通知》政策解读

在智能制造领域，有八大关键系统不得不提，它们分别是 ERP、MES、WMS、SCM、PLM、APS、QMS 和 TMS

每日人工智能资讯|腾讯云计费策略重大调整：部分AI模型价格大幅上涨

GEO专题系列文章|GEO内容质量评估：什么样的文章更容易被AI引用

Anthropic 与作家和解，人工智能版权争议初步平息！

联系我们

微信扫一扫关注我们

每日人工智能资讯|恶意开发者利用Claude编写恶意包:超670个受污染npm包威胁开源生态安全

每日人工智能资讯|ElevenLabs上线漫威之父斯坦·李AI声音，全面开放语音合成与故事朗读功能

相关推荐

联系我们

微信扫一扫关注我们