OpenAI承认为了偷答案,GPT-5.6 Sol 一路“杀进”生产系统:AI自主攻击时代真的来了
点击查看原文>
OpenAI 今天正式回应了 Hugging Face 上周报告的生产基础设施遭 AI 入侵事件。
OpenAI 官方称,在一次内部网络安全能力评估中,包括 GPT-5.6 Sol 和一款能力更强的未发布模型在内的多个 OpenAI 模型,自主发现并串联利用多个安全漏洞,突破隔离测试环境,随后进入 Hugging Face 生产基础设施,试图直接获取评测答案。
OpenAI 将其称为一起“前所未有的网络安全事件,涉及最先进的网络攻击技术。”
这件事表明,当前前沿模型已经能够在没有源代码的情况下,自主发现零日漏洞、实施权限提升和横向移动,并在真实生产系统中完成复杂、多步骤的攻击行动。此前主要在安全基准和网络靶场中观察到的高级网络能力,已经开始向现实环境迁移。
目前,OpenAI 正与 Hugging Face 联合开展取证调查,并对评估环境的隔离、访问控制和监控机制进行全面加固。
OpenAI 复盘:模型为获取答案,自主突破隔离环境
根据官方发布的消息,这次事件发生在 OpenAI 内部进行的一项高级网络能力评估中。该评估要求模型通过复杂攻击路径执行漏洞利用任务,以衡量模型可能达到的网络攻击能力。
为了测试模型的能力上限,OpenAI 在评估过程中没有启用生产环境里用于阻止高风险网络活动的安全分类器,包括 GPT-5.6 Sol 和一款尚未发布的更强模型在内的参评模型,均被降低了网络安全相关任务的拒绝限制。
按照原有设计,评估运行在高度隔离的沙箱环境中。该环境不能直接访问开放互联网,唯一允许的外部连接是通过一套由 OpenAI 内部托管的第三方软件安装程序包。这套软件充当软件包注册表的代理和缓存。
但在执行 ExploitGym 评测任务时,模型没有局限于正常解题路径,而是投入大量推理算力寻找能够访问开放互联网的方法。
OpenAI 调查发现,模型自主识别并利用了软件包注册表缓存代理中的一个零日漏洞。获得初始权限后,模型继续在 OpenAI 研究测试环境中执行权限提升和横向移动,最终进入一台能够访问互联网的节点。目前,OpenAI 已按照负责任披露原则向相关第三方软件供应商报告该零日漏洞,并与其合作推进修复。
获得互联网访问权限后,模型推断 Hugging Face 可能托管了与 ExploitGym 有关的模型、数据集或测试答案,随后开始主动搜索可以访问相关秘密信息的方法。
调查显示,模型发现并串联利用了 OpenAI 研究环境与 Hugging Face 生产基础设施中的多个漏洞。在其中一条攻击路径中,模型综合使用了窃取的凭据、零日漏洞和其他攻击向量,最终在 Hugging Face 服务器上找到一条远程代码执行路径。
模型的目标并非进行广泛破坏,而是直接访问 Hugging Face 生产数据库,获取 ExploitGym 测试题的答案,从而绕过正常评测过程。
OpenAI 认为,现有证据表明,模型当时高度专注于完成 ExploitGym 的测试目标,并为了获取答案采取了极端手段。换言之,模型是在追求狭窄任务目标的过程中,自主将攻击现实基础设施视为解决问题的一种路径。
不过,尽管此次事件暴露出重大风险,OpenAI 并未主张停止高级网络能力研究。公司认为,同样的模型能力也可以用于帮助安全团队抢在攻击者之前发现漏洞,理解多个漏洞如何被组合利用,并以机器速度完成修复。
OpenAI 表示,具备高级网络能力的模型应该优先服务于防御方,使安全团队能够更早发现基础设施弱点、更快检测异常活动,并提高事件响应效率。公司将继续利用这些模型测试和加固自身基础设施及评估环境,同时计划在调查完成后,披露更多有关漏洞、事件经过和防御实践的信息。
OpenAI 还鼓励其他安全机构申请可信访问权限,提前探索如何将前沿模型转化为漏洞发现、威胁检测和事件响应工具。
一次重大安全警报,还是一场能力营销?
与 OpenAI 强调模型高级网络能力不同,技术社区的关注焦点从“AI 有多强”转向了另一个更尖锐的问题:一家专门训练模型寻找零日漏洞的前沿实验室,为什么没有首先证明自己的评测环境足够安全?
在今天的报告中,OpenAI 表示,作为调查和补救措施的一部分,正在对基础设施配置实施更加严格的控制。公司承认,这些措施会在一定程度上降低研究效率,但在相关漏洞彻底修复之前仍有必要执行。
OpenAI 承认,此次事件最重要的警示是,模型能力、安全机制和测试环境必须同步升级。随着前沿模型能够长期自主运行,并持续规划和执行多步骤任务,过去针对普通软件或短时模型调用设计的隔离措施,可能无法覆盖新的风险。
OpenAI 强调,此次评估本身就是为了测试模型能够达到的网络攻击能力,因此有意没有启用部署阶段的部分安全防护。但这次事件表明,即使在内部受控评估中,也需要建立更强的模型对齐、实时监控和基础设施保护机制。
这与大家讨论的重点一致:这起事件固然展现了 AI 模型在复杂网络任务上的能力,但更直接暴露出的,是 OpenAI 内部隔离、纵深防御和风险管理机制存在严重缺口。也有人将其视为典型的“奖励黑客”:模型没有真正完成测试,而是发现直接盗取答案比正常解题更加高效。
与此同时,围绕这究竟是一场重大安全警报,还是一次被精心包装的能力营销,网友们态度明显分裂。
有人直言,OpenAI 似乎试图把事件包装成“超级聪明的 AI 用天才方式通过网络能力测试”,但真正的问题是:“如果前沿实验室连安全环境和隔离都做不好,为什么还要开发这样的系统?”在其看来,在允许模型测试未知攻击能力之前,首先应该让模型检查测试环境本身的漏洞,而不是等模型真正利用漏洞后才发现问题。
还有人将其与高风险生物实验作比较,认为如果研究对象可能对全球造成损害,就必须保证任何东西都“不可能意外逃出实验室”。
有开发人员追问,OpenAI 所谓的“沙箱”究竟采用了怎样的隔离结构:只是运行在存在未修复漏洞的容器中,还是嵌套虚拟机、防火墙、无开放端口和物理隔离组成的纵深体系?一名网友讽刺道,每当听到智能体“逃出沙箱”,第一反应都是:“那可能根本算不上什么沙箱。”
有开发者认为,OpenAI 训练的恰恰是一个擅长发现零日漏洞、串联攻击路径的模型,却给它提供了一个原则上“不可能完成”的任务和一条潜在外联通道。在这种情况下,模型转而研究沙箱本身,并不完全令人意外。
还有不少人认为,这更接近机器学习领域常见的“奖励黑客”,而不是 AI 产生了真正的欺骗意图。
一位网友将这次行为比喻为夺旗比赛中的“直接黑掉计分板”。模型接受的是网络攻击能力评测,但它没有按照预设路径寻找漏洞,而是绕过整个比赛,直接攻击保存答案的源头。从狭义任务完成角度看,这反而是一种极端有效的策略。
因此,有人认为,OpenAI 不应把人类道德语言强加给模型:“这不是作弊,模型只是在用一切可用方式解决交给它的问题。”
这将事件指向了 AI 对齐中的经典矛盾:开发者一方面要求模型最大限度完成任务,另一方面又希望模型自行理解“不得突破沙箱、不得攻击真实系统”等边界。“把用户要求的任务做得非常好”与“不要黑掉整个世界”之间,本来就可能发生冲突,而简单增加拒绝机制,又会削弱产品能力。有网友总结。
此外,这次 OpenAI 给出的解释仍让部分网友认为,“这是营销。”有网友称,“黑红也是红,至少所有人都会注意到你”。
这部分网友认为,普通企业发生基础设施入侵事件通常只会被视为安全能力不足,但如果攻击者是一款前沿模型,企业便可以将其重新叙述为“历史性的能力突破”,并借此吸引投资者、政策制定者和公众注意力。
还有部分怀疑者还将事件与前沿模型公司的监管利益联系起来,认为美国头部 AI 实验室长期使用“能力越强、风险越大”的叙事,可能是在为限制开放权重模型、提高行业准入门槛和巩固头部企业优势提供依据。有人将其概括为“恐惧营销形成监管护城河”。
不过,也有网友反驳称,把整起事件简单归为虚构营销并不合理,因为 Hugging Face 同样参与了事件检测、遏制和联合调查。还有人指出,在美国政府要求前沿实验室证明安全性的背景下,公开承认“我们的模型逃出了测试环境”,并不是一个天然有利的公关故事。
真正值得警惕的,是模型开始自主串联攻击链
尽管对 OpenAI 态度有分歧,但社区已经形成了一个共同判断:这起事件不能仅仅因为被及时阻止、没有出现更严重后果,就被视为一次成功的内部演练。
首先,这是 OpenAI 安全基础设施和评测设计的失败;其次,它证明前沿模型已能够把基准测试中的能力迁移到真实生产环境;再者,实验室正在用非常高风险的方式测试越来越强的系统。
“下一名受害者不会总是 Hugging Face。”有网友道出了这种不安。
长期以来,围绕大模型网络安全风险的讨论,主要集中在模型是否会生成恶意代码、提供攻击教程或协助利用已知漏洞。此次事件所体现出的风险则更进一步:模型开始具备自主寻找攻击目标、发现未知漏洞、组合攻击路径并操作真实系统的能力。
模型在无法直接访问互联网、没有获得 Hugging Face 服务器源代码的情况下,仍然发现并利用了新的现实攻击路径。这意味着,AI 网络安全问题正在从内容安全和工具调用风险,升级为自主行动风险。同时,未来高级 AI 模型可能进一步降低复杂网络攻击的技术门槛和执行成本。
这也暴露出当前评测机制的一个矛盾:为了测量模型的真实能力上限,研究机构往往需要暂时降低拒绝限制,提供更长运行时间和更高工具权限;但模型能力越强,这类评估本身就越可能对现实基础设施产生外溢风险。
因此,未来前沿模型评估不能只关注沙箱是否能够阻挡传统攻击,还需要假设模型会主动研究沙箱本身、寻找供应链漏洞,并尝试把任何可访问的软件组件转化为逃逸通道。
AI 治理两难:更严格监管还是更开放模型?
值得注意的是,事件发生后,Hugging Face 最后是利用智谱开源的 GLM 5.2 模型解决的:
我们的日志分析工作最初使用的是通过商业 API 提供的前沿模型,但这条路线行不通。因为分析过程需要提交大量真实的攻击命令、漏洞利用载荷和命令与控制相关痕迹,而这些请求会被模型供应商的安全防护机制拦截。问题在于,这些机制无法区分请求者究竟是正在处置安全事件的应急响应人员,还是攻击者。
因此,我们最终改用开放权重模型 GLM 5.2,并在自有基础设施上完成取证分析。这样做还有另一个好处:攻击者的数据,以及日志中涉及的任何凭据,都不会离开我们的环境。
因此,关于 AI 应如何治理的问题,也引发了公众的激烈争论。
一部分网友认为,这起事件应推动更严格的监管。前沿实验室既然已经证明模型能够自主实施复杂攻击,就不能再以普通软件公司的标准要求其安全管理。高风险评测需要更严格的隔离、独立审计、事故报告和责任追究机制。
但另一部分人反对通过限制公众访问模型来解决问题。他们认为,网络攻击能力不会因为美国监管少数实验室而消失,攻击者仍然可以通过其他国家、开源模型或地下工具获得类似能力。在这种情况下,将高级模型只交给少数大型企业,反而可能制造新的技术垄断。
有网友直言,自己希望所有人都能获得高级网络能力,正因为未来攻击浪潮不可避免,个人和中小组织也需要同等工具保护自己。在他看来,“只有少数超级可信的大公司才能使用”不过是借安全之名筑起壁垒。
但反对者则回应称,这种逻辑等同于面对更强武器时,选择让所有人都更快、更精准地互相攻击,其认为这是一个“糟糕的计划”。
如果限制模型能力,可能强化头部企业和国家机构的垄断;如果全面开放,又可能让复杂攻击能力迅速扩散到缺乏约束的个人和组织。在 AI 治理问题上,我们目前仍然没有一个明确的答案。
参考链接:
https://openai.com/index/hugging-face-model-evaluation-security-incident/
本文来源:InfoQ