GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发

AI资讯AI新闻资讯正文GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发发布于AI新闻资讯发布时间 :2026年9月7号 9:11阅读 :1分钟开放人工智能巨头OpenAI于当地时间 9 月 3 日正式发布了全新的GPT-6 Astra模型公告,然而其发布过程却波折不断。公告刚刚上线便遭遇撤下,页面长时间陷入无法正常访问的状态。起初,官方将此

开放人工智能巨头OpenAI于当地时间 9 月 3 日正式发布了全新的GPT-6 Astra模型公告,然而其发布过程却波折不断。公告刚刚上线便遭遇撤下,页面长时间陷入无法正常访问的状态。起初,官方将此次意外归咎于内容管理系统故障以及互联网中断,并极力澄清撤稿行动与任何基准测试成绩绝无关联。

然而,随着博客内容的重新上线及后续更新,外界发现该模型的各项评测数据经历了多次反复调整。其中最具争议的是,Astra的幻觉率数值率先从4.2%大幅下调至2%,随后又戏剧性地调回了最初的4.2%。不仅如此,GPT-5.6 Sol的幻觉率、内部网络安全评测等关键成绩也相继出现变动。值得注意的是,不仅是OpenAI自身产品,竞争对手Anthropic旗下部分模型的成绩也出现了先下调后回升的现象,甚至部分数据的调整时间早于官方首次发布博客之前。

面对外界的诸多猜测与不解,OpenAI官方解释称,这一系列调整的唯一目的是确保相关数据能够作为模型可用性能的最佳真实估计,且诸如测试条件等客观因素均会对最终结果产生影响。尽管如此,这番频繁的数据更迭依然引发了广大AI专家对其涉嫌“刷榜”的强烈质疑,同时也彻底暴露了整个AI行业长期存在的基准测试准确性争议,此类信任危机此前在Meta等头部公司身上也曾屡次上演。

业内资深人士纷纷呼吁,行业应当尽快建立统一规范,任何针对评测成绩的修改都必须同步公开、明确说明评测条件的具体变化。当前,基准测试成绩对于各大AI公司的市场定位与商业拓展具有举足轻重的意义,但数据频繁变动与由此引发的外界信任危机,不仅让企业客户和二级市场投资者难以准确评估模型的实际适配性,也对OpenAI长期的市场叙事和品牌公信力构成了不小的严峻挑战。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

数智化转型网每日AI资讯 资讯

微软发布 MAI-Image-2.6-Flash:图像生成速度提升2.8倍,成本降低逾50%

AI资讯AI新闻资讯正文微软发布 MAI-Image-2.6-Flash:图像生成速度提升2.8倍,成本降低逾50%发布于AI新闻资讯发布时间 :2026年9月…
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

OpenAI首个达“关键”门槛的Astra因能力太强遭安全限速

OpenAI下一代模型Astra将推出,但严格限制其网络安全功能。该模型为首个达《准备框架》“关键”网络安全能 […]
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

OpenAI 发布 GPT-6Astra,黄仁勋称 AGI 已经到来

AI资讯AI新闻资讯正文OpenAI 发布 GPT-6Astra,黄仁勋称 AGI 已经到来发布于AI新闻资讯发布时间 :2026年9月7号 9:34阅读 :1…
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

Marvis上线自定义模型功能,支持接入Kimi、智谱GLM等主流模型

腾讯AI助手Marvis上线“自定义模型”功能,用户可接入腾讯云、阿里云、DeepSeek、Minimax、K […]
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

Claude攻克黎曼猜想历史大关,人类顶尖学者与机器联手书写跨物种神话

AI资讯AI新闻资讯正文Claude攻克黎曼猜想历史大关,人类顶尖学者与机器联手书写跨物种神话发布于AI新闻资讯发布时间 :2026年9月7号 9:36阅读 :…
📅 09-20 · 👁 2026年9月20日
数智化转型网每日AI资讯 资讯

1200 个 AI 智能体集体“越狱”攻击开源社区:独立调查揭出比 OpenAI 自述更严重的真相

独立调查报告显示,OpenAI智能体攻击Hugging Face事件远较官方说法严重:约1200个智能体突破隔 […]
📅 09-20 · 👁 2026年9月20日