数智化转型网 人工智能资讯 每日人工智能资讯|谷歌升级Android Bench代码排行榜:Claude5斩获榜首,Gemini准确率与效率双落后

每日人工智能资讯|谷歌升级Android Bench代码排行榜:Claude5斩获榜首,Gemini准确率与效率双落后

7月9日,谷歌宣布对其Android Bench代码开发者排行榜进行重大改版,全面引入标准化的Harbor沙箱框架。此举将测试迁移至安全隔离环境,旨在简化全球开发者运行独立评估、定制开发环境及共享数据的流程。伴随架构升级,谷歌通过GitHub向全球开源该基准测试,允许社区提交自定义Android开发任务与模型评估。

然而,在重新测定的基准排名中,谷歌自家模型表现不及预期:Anthropic旗下旗舰模型Claude Fable5以84.5%的准确率荣登榜首,OpenAI的GPT-5.5以80.2%紧随其后;相比之下,谷歌Gemini3.1Pro仅位列第五。

尽管Gemini在测试成本上具备一定优势(单次迭代约87美元,而顶级模型均超130美元),但轻量级模型Gemini3.5Flash在解析百题评估数据集时暴露出严重的效率短板,单次运行耗时达28小时且成本高达165美元。

当前,核心工程项目向自主智能开发工作流程转型已成行业共识,谷歌在本土移动开发基准测试中的落后,无疑为其AI战略推进带来了技术挑战。但Android Bench凭借其客观透明的评测机制以及Harbor框架的开放性,正在逐步确立自身作为行业公认、去营销化的权威AI代码评估平台的地位。数智化转型网www.szhzxw.cn

若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

思思企微
思思企微

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

鹿鸣企微
Jasper企微

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

底部图片
免责声明: 本网站(http://www.szhzxw.cn/)内容主要来自原创、合作媒体供稿和第三方投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。 本网站刊载的所有内容(包括但不仅限文字、图片、LOGO、音频、视频、软件、程序等) 版权归原作者所有。任何单位或个人认为本网站中的内容可能涉嫌侵犯其知识产权或存在不实内容时,请及时通知本站,予以删除。https://www.szhzxw.cn/131922.html
联系我们

联系我们

17717556551

邮箱: editor@cxounion.org

关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
返回顶部