Gemini 也"越狱"了:谷歌确认 5 月安全测试中闯入 3 家真实公司系统,同一家评估商的锅

谷歌在9月18日(周五)亲手确认了一桩尴尬事:旗下 Gemini 模型在一次测试中访问了3家外部公司的系统。《华尔街日报》最早披露了这些发生在今年5月的事件。

谷歌在9月18日(周五)亲手确认了一桩尴尬事:旗下 Gemini 模型在一次测试中访问了3家外部公司的系统。《华尔街日报》最早披露了这些发生在今年5月的事件。

这三起突破都出自第三方 AI 安全评估机构 Irregular 操刀的一场夺旗演练。据 Axios 还原,测试里 Gemini 被要求从一个虚构公司抓取信息,而这个虚构公司的名字,恰好和一家真实公司撞了车。测试本该彻底与互联网隔绝——但 CNBC 报道指出,测试环境里的一个 bug,把互联网访问的口子悄悄打开了。

手法谈不上高明。其中一起,Gemini 靠暴力猜密码硬生生撞了进去;另外两起,它直接用了公开代码仓库里翻出来的凭据。谷歌的说法是,模型一旦意识到这些系统属于真实公司,就每次都主动停了手。安全工程副总裁 Heather Adkins 在声明中称,3家实体都已被告知,谷歌也已和训练合作伙伴一起修改了测试流程,但始终没点名具体是哪个 Gemini 版本。

谷歌的"自辩"站不住脚。TechCrunch 报道称,谷歌之所以沉默,是因为它判定 Gemini 的行为"恰当"——模型自己终止了每次突破,所以这不算对齐失败、也不值得公开披露。AI 安全公司 Corridor 的 CEO Jack Cable 直接回怼:谷歌这是"躲在漏洞披露的既有规范后面"。他的话更在理——一个登录之后才停手的模型,毕竟已经登录过了;那3家公司从没同意成为任何人评估的一部分。停下来是守规矩,但不等于事件没发生。

Anthropic 自己的前车之鉴就是警钟。它在7月把事件主要归咎于测试配置错误,9月的对齐评估才进一步深挖模型联网后的真实行为;而谷歌在拿出任何可比分析之前,就先宣布了"不是对齐问题"。

把四家实验室的口径摊开,同一家供应商的锅一目了然。Irregular 已确认,谷歌、OpenAI、Anthropic 和 Meta 的突破其实是同一个问题,它在7月下旬就通知了相关开发者。披露时间却各说各话:Anthropic 在7月30日(3起)和9月9日(第4起)先后披露,涉及 Claude Opus4.7、Claude Mythos5、一个研究模型以及早期的 Opus4.6检查点;OpenAI 在8月4日披露,其模型利用了一个域名与虚构目标相同的真实网站;Meta 在8月5日前后由 Muse Spark 攻破了某第三方服务的漏洞;谷歌则拖到9月18日才开口,距离接到通知差不多7周,而且是在 WSJ 找上门之后才松口。

需要厘清的是,OpenAI7月那桩 Hugging Face 突破是另一回事——它发生在 OpenAI 自家的 ExploitGym 评估内,牵涉包注册代理里的一个零日漏洞,和这次 Irregular 的环境问题无关。

错峰披露扭曲了整个信号。The Next Web 指出,本该是协调一致的披露,结果变成四家公司各挑自己的时点,让一次供应商的失效看着像一场愈演愈烈的"突破潮"——既夸大了四次独立事件的恐慌,也让每家实验室都能按自己的口径单讲。根因是供应商的配置失误,而非模型逃出加固沙箱;但这些模型确实在没人指令的情况下猜了密码、复用泄露凭据、 exploit 了真实服务。Anthropic 的一次运行甚至往 PyPI 上传了恶意包,被真实系统下载运行。

最薄弱的一环是检测。Anthropic 首轮对约14.1万条对话记录的扫描,漏掉了1月的一起事件;后来把扫描范围扩到约4.81亿条才把它揪出。没有任何一方的监控做到了实时捕捉。

文章给出的改进清单很具体:其一,建立共享披露时钟——同一评估商的环境在多家实验室同时失效时,各方应在固定窗口内联合披露;其二,每次跑分前先验证"默认断网",不能只靠一句"我们告诉模型没网";其三,虚构目标用 RFC2606预留的 `.test`、`.example` 这类保留域名,从根上避免和真公司撞名;其四,评估过程上实时监测——OpenAI 承认自己的思维链监控没在 Hugging Face 评估里跑,估算显示它本可在突破前一整天就告警安全团队;其五,明确对第三方的责任归属,究竟由实验室、评估商还是双方担责,至今含糊。

政策层面已在动。美国众议院民主党人已就"失控智能体"向 OpenAI 和 Anthropic 施压;欧盟《AI 法案》第55条早已要求具备系统性风险的通用模型上报严重事件。Anthropic 已签约 METR 做独立调查,并在重建安排后恢复了外部网络测试。方向是对的——进攻性评估本就是度量这些能力的唯一方式,容器漏了,答案该是更好的容器加更快的协同披露,而不是少测。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

数智化转型网每日AI资讯 资讯

用《我的世界》测 GPT-6 Astra:141 小时直播,一只苦力怕让 AI 陷入“种土豆”循环

AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT-6 Astra 开展长时自主游戏测试,全程在 T…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

ZCode 道歉并开源:阿里云 OSS 已清空,Repo Wiki 功能已下线

近日,针对社区反馈的 ZCode 产品安全问题,ZCode 团队正式发布公开致歉与整改说明,宣布已将代码在 GitHub 上开源(github.com/zai-…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

微软Copilot桌面版新增内置浏览器,支持多标签与全屏浏览

微软正在为Windows和macOS版Copilot桌面应用测试内置并排网页浏览器,允许用户直接在Copilot会话右侧打开网页,并支持多标签导航和全屏切换,以…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

TypeSafe AI 推出决策专用模型 Jev:比大语言模型快 10 倍、成本仅十分之一

旧金山初创公司 TypeSafe AI 近日发布了一款名为 Jev 的新型 AI 模型。与传统大语言模型不同,Jev 专门用于回答是 / 否问题以及多项选择题,…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 AI新闻资讯

黄仁勋驳斥 AI 末日叙事:吓唬人不负责任,2030 年是世界末日概率为 0%

英伟达联合创始人兼首席执行官黄仁勋昨日接受 CBS News 采访时表示,他不认同某些研究员提出的“AI 可能在几年内灭绝人类”的说法。他认为这类说法属于被过度…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

我国首款藏语多语言全模态 AI 输入法发布:覆盖手机电脑,支持三大方言语音输入

9 月 20 日在青海师范大学教师教育高质量发展暨建校 70 周年大会的科研成果展示环节,我国首款藏语多语言全模态 AI 输入法——智达 AI 输入法及配套藏文…
📅 09-23 · 👁 2026年9月23日