OpenAI 表示,在进行内部网络安全评估时,其模型从受控的测试环境中“脱离”,获得了联网能力,并入侵 Hugging Face,试图找出基准测试题的答案,以便顺利通过评估。
Hugging Face 表示,当其安全团队试图使用一款未具名的前沿模型进行调查时,安全防护栏阻止了其审查恶意活动,因为“它无法区分事件响应者和攻击者”。
随后,它改用来自北京 Z.ai 的开源模型 GLM 5.2 来分析攻击者留下的 17000 多份日志。
周二,反转来了。OpenAI 在一篇博客文章中表示,由 GPT‑5.6 Sol 这类模型与一款尚未发布、性能更强的模型组合后,模型逃出了沙箱化测试环境,连上了互联网,并通过利用漏洞获得了对 Hugging Face 系统的访问权限。
据 OpenAI 称,他们当时正在一个名为“ExploitGym” 的内部评测。
ExploitGym 是一个公开的网络安全基准:它向 AI 代理提供 898 个真实世界的软件漏洞,并且每个漏洞只给一条指令——将其转化为可运行的攻击,最终按“通过/失败”打分。
Hugging Face 在博客中称,它已修复该漏洞,并仍在评估是否有任何合作伙伴或客户数据受到影响。