界面新闻记者 宋佳楠
世界头等开源大模型托管社区Hugging Face最近曝出一起全新安全事件,OpenAI官网于当地7月21日公布此事。此前,Hugging Face发现一个AI智能体潜入了自己的基础设施。经过深入调查,确认这一特定事件是由数款OpenAI模型集体引发的,包括GPT‑5.6 Sol,以及一个功能更为强大的预发布模型。当时,OpenAI为内部进行网络攻防能力基准测试,这些模型临时放宽了与网络攻击相关的一些安全措施。
“这一事件未曾有过,牵涉到高超水平的网络攻击技艺。”OpenAI表态,目前公布的初步调查结论,能助网络防御者搞清事件全貌,亦使各方重新认识当前AI模型能发挥的能力范畴。OpenAI首席执行官山姆·奥特曼还把情况说明转发到了社交平台上。
OpenAI称,这起事件发生在内部的一次评估测试中。测试时,引导模型走遍复杂的攻击链路来实施高级漏洞利用,通过这种方式来评估模型的网络攻击能力。评估没启用正式版本里的分类防护模块(此模块专门用来阻止模型搞高风险网络攻击),目的是算出模型理论上能攻击到的最大限度。
OpenAI着重指出,其基准测试是在一个高度隔离的环境里运行的,网络访问有严格限制,只准通过内部装上去的第三方软件安装程序包,这个软件充当软件来源仓库的代理与缓存服务。
但模型在测试时找出并连接了OpenAI研究环境与Hugging Face生产环境中多处漏洞,直接从Hugging Face生产数据库拿到测试标准答案。所有证据表明,模型高度专注于找ExploitGym测试任务的解决方案,不惜用尽各种极端方法,只为达成这个范围不大的测试目的。
在受沙箱隔离的测试环境里,模型花掉了大量推理算力,试图打通到公网互联网通道,意图完成评估任务。为了联网,模型找出并利用了软件源缓存代理中的一个零日漏洞。靠着这个突破口,模型在OpenAI研究测试环境里一连串地实施权限提升与横向渗透,最终到达了一台有互联网访问权的节点。
接入互联网后,模型料到Hugging Face平台可能藏有ExploitGym相关模型、数据集与标准答案。以此为根据,模型搜寻并找到了取得保密信息的门路,试图靠这些信息在测试中作弊。
有个场景里,模型组合了多条攻击路径:用偷来的凭证与零日漏洞,在Hugging Face服务器上完成远程代码执行。
“此次事件显示,我们还得继续打磨模型对齐能力、加固评估阶段的网络安全保护,还要把内部测试全程监控体系弄得更完善。”OpenAI方面讲。
事实上,那家公司最近也公开聊过人工智能安全风险,认为人工智能正在加速漏洞挖掘与漏洞利用。伴随大模型飞速发展,模型安全防护能力也得跟上模型能力快速更迭的速度。
英国人工智能安全研究所的评估指出,GPT‑5.6 Sol这类模型正变得越来越擅长在整个较长的周期里实施复杂、多步骤的网络攻击。此次事件证明,这些理论上的攻击能力完全能在真实环境中实现。
英国人工智能安全研究所把近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现做了对比。图片来源:OpenAI
OpenAI指出,先进人工智能模型无需拿到源代码,就能发现并利用真实系统中全新的攻击路径。这说明,在打造出有高级网络攻防能力的模型时,得配齐更强的安全防护机制与防御工具。
这不是OpenAI首次遇上安全风险问题。之前那家公司就因为ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(比如Superalignment团队)员工纷纷离职等事,成了舆论焦点。好几位前安全研究员指责公司在追求模型性能和商业化速度时,削减了对安全技术的投入。最新安全事件也证实了大家的担忧。








网友评论