7月9日,谷歌宣布对其Android Bench代码开发者排行榜进行重大改版,全面引入标准化的Harbor沙箱框架。此举将测试迁移至安全隔离环境,旨在简化全球开发者运行独立评估、定制开发环境及共享数据的流程。伴随架构升级,谷歌通过GitHub向全球开源该基准测试,允许社区提交自定义Android开发任务与模型评估。
然而,在重新测定的基准排名中,谷歌自家模型表现不及预期:Anthropic旗下旗舰模型Claude Fable5以84.5%的准确率荣登榜首,OpenAI的GPT-5.5以80.2%紧随其后;相比之下,谷歌Gemini3.1Pro仅位列第五。
尽管Gemini在测试成本上具备一定优势(单次迭代约87美元,而顶级模型均超130美元),但轻量级模型Gemini3.5Flash在解析百题评估数据集时暴露出严重的效率短板,单次运行耗时达28小时且成本高达165美元。
当前,核心工程项目向自主智能开发工作流程转型已成行业共识,谷歌在本土移动开发基准测试中的落后,无疑为其AI战略推进带来了技术挑战。但Android Bench凭借其客观透明的评测机制以及Harbor框架的开放性,正在逐步确立自身作为行业公认、去营销化的权威AI代码评估平台的地位。数智化转型网www.szhzxw.cn
若您对人工智能感兴趣或为人工智能创始人,可添加数智化转型网小助手思思微信加入人工智能交流群。若您在寻找人工智能供应商,可联系数智化转型网小助手思思(17757154048,微信同号)

若您为人工智能服务商,可添加数智化转型网小助手Jasper,加入人工智能行业交流群。

声明:本文来自数智化转型网,版权归作者所有。文章内容仅代表作者独立观点,不代表数智化转型网立场,转载目的在于传递更多信息。如有侵权,请联系我们。

本文由数智化转型网(www.szhzxw.cn)转载,编辑/翻译:数智化转型网(Professionalism Achieves Leadership 专业造就领导者)白龙
