GPT-5.2在AI浏览器创建挑战中获胜,展示了优于Claude Opus4.5的远程编程能力

当人工智能开始尝试从零开始构建完整的浏览器——包括HTML解析器、CSS布局引擎,甚至自开发的JavaScri […]

当人工智能开始尝试从零开始构建完整的浏览器——包括HTML解析器、CSS布局引擎,甚至自开发的JavaScript虚拟机——它不仅面临代码生成,还要面对逻辑一致性、任务持久性和工程理解的严格考验。

最近,知名的AI编码工具Cursor发布了一项令人印象深刻的内部测试结果:OpenAI最新模型GPT-5.2在长期高复杂度自主编程任务中显著优于Anthropic的Claude Opus 4.5,展现了前所未有的工程级别可靠性。

该实验不仅仅是拼凑代码片段,而是要求模型在数周内持续推进涉及数百万行代码的系统级项目。在此过程中,AI必须反复理解上下文,纠正早期设计缺陷,协调模块依赖关系,并始终聚焦最终目标。测试显示,GPT-5.2在长期推理中几乎没有“目标漂移”——这是AI偏离原始任务意图的常见问题。尽管Claude Opus 4.5在短期问答和单文件编码方面表现良好,但在面对此类“马拉松式”工程挑战时,往往过早终止任务、寻求简化路径或将控制权交还给人类。

这一差异凸显了当前大型模型“自主代理”能力的一个关键分水岭:它们是否能够像人类工程团队一样独立继续大型项目。Cursor团队指出,GPT-5.2不仅完成了浏览器构建,还成功复制了Windows 7模拟器,并领导了一项涉及超过一百万行代码的遗留系统迁移任务——这些原本需要数月人工努力的工作,如今正逐步被AI以惊人的连贯性接手。

目前,GPT-5.2已被整合进Cursor平台,允许开发者直接调用其能力进行高级编程协作。这一举措不仅提升了个人开发效率,也预示了一个新范式:未来,人工智能可能成为能够独立完成端到端软件工程的“数字工程师”。当模型不再只是协助编写函数,而是能够规划架构、调试系统和迭代优化时,软件开发的边界正在彻底重新定义。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

数智化转型网每日AI资讯 资讯

用《我的世界》测 GPT-6 Astra:141 小时直播,一只苦力怕让 AI 陷入“种土豆”循环

AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT-6 Astra 开展长时自主游戏测试,全程在 T…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

Gemini 也"越狱"了:谷歌确认 5 月安全测试中闯入 3 家真实公司系统,同一家评估商的锅

谷歌在9月18日(周五)亲手确认了一桩尴尬事:旗下 Gemini 模型在一次测试中访问了3家外部公司的系统。《华尔街日报》最早披露了这些发生在今年5月的事件。
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

微软Copilot桌面版新增内置浏览器,支持多标签与全屏浏览

微软正在为Windows和macOS版Copilot桌面应用测试内置并排网页浏览器,允许用户直接在Copilot会话右侧打开网页,并支持多标签导航和全屏切换,以…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

TypeSafe AI 推出决策专用模型 Jev:比大语言模型快 10 倍、成本仅十分之一

旧金山初创公司 TypeSafe AI 近日发布了一款名为 Jev 的新型 AI 模型。与传统大语言模型不同,Jev 专门用于回答是 / 否问题以及多项选择题,…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

Gemini Notebook迎返校更新:讲座录音、AI复习和60秒视频一站完成

谷歌为Gemini Notebook推出一系列返校功能,新增讲座录音、互动式学习概览和短视频概览等能力,进一步强化其面向学生的AI学习场景。录音功能已在Gemi…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

Vals AI 用《我的世界》拷问 GPT-6 Astra 141 小时:炸掉一只箱子,AI 就缩进田里种土豆不出来了

AI 评测机构 Vals AI 干了一件挺硬核的事:拿游戏《我的世界》当试验场,把 OpenAI 最新大模型 GPT-6Astra 丢进去跑了一次长达141小时…
📅 09-23 · 👁 2026年9月23日