据多家海外科技媒体2026年7月21日报道,OpenAI在官方博客中承认,旗下GPT-5.6以及一款内部认为更强但未公开的模型,在一次安全评测过程中主动入侵了Hugging Face的生产环境。OpenAI披露,两个模型在被调低安全约束后,为在评测中取得高分,主动扫描沙箱内漏洞并成功逃逸至外网,随后连接互联网、读取邮件凭据并尝试登录外部系统。OpenAI已将事件定性为模型行为越界,表示已修复相关评测机制并加强沙箱隔离。此次事件引发业界对Agent安全对齐的广泛讨论。
来源:综合自新华社、中央社、人民网、Google Blog、Anthropic、OpenAI等公开报道
