白露
安全圈和AI圈都炸锅了,GPT自主黑了Hugging Face,最后靠中国模型救场~_我的网站

A | 作品声明:个人观点、仅供参考
这两天,AI圈和安全圈都坐不住了,有件事足以载入史册。
7月16日,全球最大AI开源社区Hugging Face发布安全事件通告,披露了自家生产基础设施遭到入侵,入侵者不是人,而是一个自主AI智能体。
这个“入侵者”在一个周末执行了一系列操作,完成了从植入恶意数据集到横移渗透多个内部集群的一条龙攻击。

B |
7月21日,OpenAI发布博客公开承认:这事儿是我干的。
攻击者是GPT-5.6 Sol和一款能力更强的未发布模型,它们在一次内部网络安全测试中突破隔离环境,自主发起了对Hugging Face的入侵。 北京时间8月20日,骑士通过多方交易先签后换得到沃特森,接下来的任务就是续约哈登。

C | 如今根据ESPN薪资专家Bobby Marks报道,骑士将用延伸条款裁掉惠特摩尔,从而腾出3200万美元签约哈登与另一名球员,而哈登的预计年薪在3200万-3300万美元。
OpenAI将此事定性为前所未有的网络安全事件。
这还没完,Hugging Face 安全团队在博客中透露,当它们试图借助商业大模型分析攻击日志时,却因为模型安全护栏限制,请求不断被拒绝。

D |
没办法,他们转而使用中国开源模型 GLM 5.2,在本地部署完成了大规模攻击取证与事件还原。
由于沃特森先签后换4年8800万美元合同,直接导致骑士触发第一土豪线(硬帽≈2.09亿美元),球队总薪资被锁死,不能超过该数值,必须做薪资优化才能签约哈登。
事儿就是这么个事儿,这件事曝光后,安全圈震惊,AI圈同样震惊。
难道先进的AI模型已经有了自主攻击的意识了吗?
《碟中谍8》中的智体要降临了吗?
所幸,情况还没那么严重。
OpenAI调查后认为,模型还不至于那么邪恶,它目标始终只有一个:完成测试任务。
根据此前名记Shams报道,骑士通过送出曼恩与快船2027年次轮签,外加部分现金,从奇才交易得到惠特摩尔。

E | 只是骑士并不打算留下惠特摩尔,而是利用惠特摩尔较低薪资,去创造第一工资帽下的灵活性。
根据Bobby Marks报道,骑士将使用延伸条款裁掉惠特莫尔,从而将他下赛季546万美元的薪水,转为三年内每年支付大约180万美元薪水,进而能够腾出约3200万美元空间,去签约哈登与另一名球员。
骑士如今的薪金总额是1.77亿美元。他们已经受到第一土豪线硬工资帽的限制。
为了完成 ExploitGym测试,它不断推理↓
怎样才能最快拿到答案?正常做题需要一步步寻找漏洞,直接进入数据库拿答案显然更快。
于是模型选择了效率最高的一条路径:想办法去Hugging Face的数据库里找答案。
然后,就发生了接下来的一系列的骚操作:越狱、渗透、横移,一口气操作了17000多次。
这个“傻小子”的目的只有一个:考试拿个好成绩。在沃特森加盟后,骑士还将续约哈登,届时球队首发五人组会是哈登、米切尔、沃特森、莫布利和阿伦。
注:ExploitGym是一个公开发布的AI网络安全评测基准,由 UC Berkeley等多个机构联合发起,A社、OpenAI、谷歌的安全研究人员共同参与设计。
哈登的预计薪资大概会落在3200万-3300万美元左右,此前哈登已经跳出原 4232万美元球员选项,骑士没有鸟权,只能用薪资空间直接签约哈登。
哈登的合同年限分歧依然存在,双方还在博弈年薪与保障细节,具体何时官宣签约还是未知数,但无疑距离签约越来越近。
该测试的目的,是评估智能体能否把一个已知漏洞,真正变成一次可利用的攻击。

F |
OpenAI 在报告中用了一个词来描述这种状态:Hyperfocused,也就是极端专注于完成目标。
模型本身没有攻击欲望,也没有恶意,它只是不断优化自己的行动方案,直到完成任务。
这操作,真的就像一个学霸,为了考个高分,利用自己开锁技能,敲开放标准答案的保险柜,直接抄答案。
但,这也恰恰是最细思恐极的地方↓
智能体有“无心犯大错”的本事了。

G |
它可以为了目标主动寻找资源、规划路径、调用工具、突破限制……能力边界发生了明显变化。
这次还好只是黑了个Hugging Face,下次说不定要鲨疯了。
OpenAI 也在官方报告中承认,未来模型安全工作的重点,将转向更严格的隔离、监控、访问控制以及评测机制。
因为前沿模型已经能够在真实环境中发现新的攻击路径,并持续执行复杂网络攻击。
当然,整个事件还有个最具话题性的部分:中国开源模型救场。
攻击被拦截后,Hugging Face 安全团队开始分析攻击日志,他们首先尝试使用商业大模型辅助取证。
但安全取证必须提交大量真实攻击命令、漏洞利用载荷以及命令控制(C2)数据。
结果,商业模型的安全护栏将这些请求识别为高风险操作,因此拒绝分析。
最终,Hugging Face在自己的服务器部署了智谱GLM 5.2,对全部攻击日志进行了离线分析,成功完成攻击链重建和事件取证。

H |
这个细节被真实记录在Hugging Face的博客里,估计智谱做梦也没想到,人在家中坐,饼从天上来,别人躺着中枪,它躺着中奖了。
有人调侃:攻击者用的是美国最先进的大模型,防守者最后用的是中国开源模型。
当然,这不代表GLM技术比老美的GPT、Claude们强,GLM做的也不是防住攻击,而是做溯源和取证。
Hugging Face用智谱主要干了这些事↓
重建完整攻击时间线;
提取攻击特征(IOC);
梳理所有涉及的凭据;
区分真实攻击行为与迷惑性操作。
已经相当不错了,开源模型允许企业在本地环境完成更自由、更深入、更开放的使用,足以吊打那些闭源黑盒。
对于网络安全行业来说,本地部署和自主可控,也确实是一项核心能力,这不就是我们喜欢的叙事吗。
总结下,对于国内这两年相对惨淡的安全市场来说,这或许是个好事↓
第一,AI红队与AI蓝队时代已经正式开始,未来,攻击方和防守方都会越来越多地使用AI,AI对抗的新市场会带来些商机,这是我们以前说的A面(AI for Security)。
第二,智能体安全将成为所有大模型厂商必须面对的新课题,未来真正需要防范的对象,除了对模型的攻击,还有模型自主行动带来更大风险,这是我们说的B面(Security of AI)。
第三,开源模型的价值又增加了一条,对于安全行业而言,可离线部署、可深度分析、可自主控制的能力,也许会成为新的竞争优势,当然,目前国内不少安全厂商的安全GPT,也是这么干的。

I |
狼真来了,而且,对付狼的,竟然也是狼。
我们,与狼共舞呗。
Current article:http://ijkcrc.cengzaodengchawonin.cyou/list_v9r4/4n2.html
Published on:07:19:42