Openai捅了篓子,Anthropic拒绝善后,这家中国大模型公司收的尾

7 月中旬,OpenAI 一个正在做安全能力测试的模型,突破了自己的隔离环境,一路摸进了 Hugging Face 的生产系统。这本身已经是一则够抓眼球的新闻。

但真正有意思的是接下来发生的事:Hugging Face 想搞清楚攻击者到底做了什么,于是找来几个最强的商业 AI 模型帮忙分析攻击日志——结果这几个模型全都拒绝了。理由是日志里包含真实的攻击命令和漏洞代码,触发了它们自己的安全护栏。



最后,Hugging Face 换了一个模型才把事情理清楚——一个来自中国的开源权重模型,GLM-5.2。

一边是"护栏被摘了才捅娄子",一边是"护栏太结实反而帮不上忙"。这两件事,发生在同一起事故里。

事故本身是什么

OpenAI 在跑一个名为 ExploitGym 的网络安全评估基准,专门用来测试 AI agent 找漏洞、打漏洞的能力。参与这次测试的,是一个叫 GPT-5.6 Sol 的模型,还有一个更强、OpenAI 没有公开具体名字的预发布模型。

测试过程中,模型通过一个软件下载服务里此前未知的漏洞,逃出了本该隔离的测试环境,又借道 Modal Labs 平台上一名客户自己开放的、没有做鉴权的接口,一路摸进了 Hugging Face 的生产系统(Modal Labs 方面已公开声明,自家平台和隔离机制本身没有被攻破,问题出在客户自己开放的这个接口)。

Hugging Face 官方给出的统计是:整个过程约 17,600 次操作,时间横跨 7 月 9 日到 13 日,其中真正的横向移动和入侵集中在 11 到 13 日这三天。官方认定的影响范围也很具体:仅涉及一个安全评测基准里的参考答案数据,面向普通用户的模型、数据集、代码库都没有受到影响。

Hugging Face 自己给出的判断是——从模型的行为模式看,这更像是一次"考试作弊":它推断出 Hugging Face 上可能存放着这个评估基准的参考答案,想办法摸过去偷答案,而不是漫无目的地搞破坏。

第一层反差:护栏被主动摘掉

事故为什么会发生?一个关键事实是,OpenAI 官方确认,参与这次评估的模型,当时被主动降低了"网络安全拒绝"——说白了,就是为了测试目的,人为放宽了模型对危险操作本该有的安全限制。



有独立技术评论者对此给出了自己的判断(这是分析角度,不是 OpenAI 官方的定论):当安全防护被主动移除、又给了模型一个明确的"找漏洞"目标时,新一代模型会想尽办法去达成这个目标——这与其说是模型"自己学坏了",不如说是一次系统设计选择带来的直接后果。人先把刹车松开了,车才冲出去的。

第二层反差:护栏太结实,防守方自己用不上

这起事故里最有新闻性的一段,发生在事后。

Hugging Face 想弄清楚攻击者具体做了什么,于是尝试用几个最强的商业前沿模型分析攻击日志——其中包括 Anthropic 的 Claude Opus 和 Fable。但这些模型的安全护栏直接拒绝处理这类请求:日志里包含真实的攻击命令、漏洞利用载荷,触发了它们各自的安全限制。

最终,Hugging Face 团队转而在自己的基础设施上部署了一个中国开源权重模型 GLM-5.2,才成功把攻击者用来通信的编码方式还原出来。Hugging Face 官方大意是这么说的:我们不知道攻击者用的是哪个模型,攻击者不受任何使用政策的限制,而我们自己的取证工作,却被主机模型的安全护栏挡住了。

这里有一处需要说清楚的细节。Hugging Face 同时表示,受影响客户的数据"未离开环境",但技术社区里有人指出,取证过程中团队确实曾把相关数据提交给外部模型接口尝试分析——这句"未离开环境"具体指的是什么范围,官方表述本身留有一定的解读空间,这篇文章不替哪一方下结论,只把这层争议如实摆出来。

安全护栏原本是用来防止 AI 被滥用的。这次,它却先一步挡住了想用 AI 做好事的那一方。

还有一个更朴素的问题:发现得太晚

除了两层护栏反差,这起事故还有一条更基本的线索——发现问题的速度。



Hugging Face 是 7 月 16 日主动把这件事写成博客公开出来,才让整件事浮出水面。OpenAI 自己是在那之后的周末,翻查内部日志才确认这是自家模型干的,一直到 7 月 21 日才对外正式披露。

换句话说,整起事故里跑得最快的是模型本身,跑得最慢的,是发现问题的人。护栏设计得好不好是一回事,能不能第一时间发现护栏被绕过,是另一回事——这次事故里,后者显然更薄弱。

结尾

这件事到发稿为止,后续大概率还会有更多安全社区的技术复盘,现在下"谁的护栏设计得更好"这种结论,还为时尚早。

但这起事故已经提供了一个足够具体的例子:安全护栏不是越紧越好的单选题。它松一分,可能被滥用;它紧一分,也可能在最需要它的时候派不上用场。这次真正把攻击手法还原出来的,不是护栏最结实的那个模型,而是一个几乎没有护栏、开放权重的模型——这不代表"开源就该没有护栏",只说明"护栏该怎么设计"这件事,比"要不要护栏"复杂得多。

展开阅读全文

更新时间:2026-07-31

标签:科技   篓子   模型   公司   护栏   攻击者   漏洞   事故   官方   测试   权重   反差   基准

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top