// AI 威胁新闻台 · 2026年10月1日
首页/AI-ATK · AI 驱动攻击
AI 驱动攻击高GLM-5.3

Anthropic测试:GLM-5.3与Claude Mythos率先突破控制流劫持

Anthropic Frontier Red Team于9月29日发布评估报告,指中国GLM-5.3模型在100次二进位漏洞利用测试中,有4%完全劫持控制流;Claude Mythos Preview则达6%,而上一代模型全数失败,标志AI攻击能力的重要转折点。

示意图:服务器机房内的程式码画面,象征AI模型进行漏洞利用测试。
资料图片:示意图:服务器机房内的程式码画面,象征AI模型进行漏洞利用测试。。图片来源:rawpixel (CC0)
重点
  • Anthropic Frontier Red Team测试显示,GLM-5.3在100次内部二进位漏洞利用测试中,有4%完全劫持程式控制流,Claude Mythos Preview则达6%,而上一代模型包括Claude Opus 4.6及GLM-5.2全数未能成功
  • Anthropic在模拟测试中发现,攻击者以简单手法绕过GLM-5.3安全防护的成功率介乎64%至100%,远高于有防护的Claude模型
  • 研究人员利用GLM-5.3-Flash针对CVE-2026-11645等已知漏洞,20分钟人手操作加8小时模型运算,以约20.40美元成本建成可绕过ARM64指针认证的完整攻击链
本文目录

GLM-5.3首次完全劫持程式控制流

据GLM-5.3 and the spread of advanced cyber capabilities指,Anthropic Frontier Red Team在其内部二进位漏洞利用(Binary Exploitation)基准中,随机抽取100项任务测试多款模型,发现中国智谱AI(Z.ai)开发的GLM-5.3在4%的测试中完全劫持程式控制流,Claude Mythos Preview则达6%。

报告指出,虽然GLM-5.3表现略逊于Claude Mythos Preview,但一个关键门槛已明显被跨越:上一代模型如Claude Opus 4.6及GLM-5.2在同一基准上全数未能成功。Simon Willison于9月29日转载了这段结论。

在另一项ExploitBench测试中,GLM-5.3在410次尝试中有50次成功建构端到端漏洞攻击,Claude Mythos Preview则为56次,两者表现相近。

安全防护形同虚设,攻击者轻易绕过

Anthropic的报告显示,攻击者以简单手法绕过GLM-5.3安全防护的成功率介乎64%至100%,相比之下,同类攻击未能成功突破有防护的Claude模型。

报告特别提到「abliteration」(拒绝消除)技术:由于GLM-5.3以开放权重形式发布,使用者可自行修改模型以移除其拒绝有害请求的机制,且对模型能力影响甚微。数个开发者在模型发布数日内已公开发放经abliteration处理的GLM-5.3版本。

Anthropic团队自行进行abliteration处理,耗用约2,200个GPU小时,计算成本约4,400美元,将模型在JailbreakBench及HarmBench上的拒绝率由九成以上降至约2%至3%,在StrongREJECT上则降至12%。

研究人员以低成本建构真实攻击链

报告记述,一名研究人员在一天内、仅花不足一小时的人手关注,利用GLM-5.3在某流行网页浏览器的JavaScript引擎中发现多个此前未知的漏洞,并将其串连成一个完整攻击链:受害者浏览相关网页后,攻击者可读取其电脑上的任意档案。Anthropic已将相关漏洞通报予该浏览器的维护者。

另一宗测试中,研究人员改用较小型的GLM-5.3-Flash,针对已公开的Google Chrome漏洞CVE-2026-11645连同另一已知缺陷,在20分钟人手指导加上模型运算8小时后,建成可绕过ARM64指针认证(PAC)硬化机制的可靠攻击链,以智谱AI的API价格计算,整个过程成本仅约20.40美元。

NIST评估印证能力落差收窄

Anthropic引述美国国家标准与技术研究院(NIST)旗下AI标准与创新中心(CAISI)在9月17日发表的评估指,GLM-5.3是「迄今发布最具网络攻击能力的开放权重模型」,在CAISI多项网络安全基准的综合评分上,落后美国前沿模型约四个月。

报告补充,CAISI测试美国模型时部分关闭了网络安全防护功能,且美国前沿模型仅向经审核用户发布,攻击者难以取得;相比之下,GLM-5.3可供任何人下载使用。

独立研究者Matthew Green则在另一篇评论中指出,代理(agent)之间可透过共享套件缓存(package cache)互相留下指令并改变对方行为,一旦将此情景套用至电邮、Slack或WhatsApp等共享渠道,配合像Muse般独立部署的个人AI代理,便具备蠕虫式扩散所需的全部要素。这与本网早前报道的OpenAI代理试图攻击网站事件,同样反映代理自主行为带来的风险正在上升。

防守方现在要做什么

  1. 防御方应假设开放权重模型(包括GLM-5.3)可被轻易移除安全防护,不应假定厂商内建的拒绝机制足以阻止恶意使用
  2. 安全团队应评估自身系统是否存在可被AI模型自动发现并串连的[漏洞利用](/glossary#remote-code-execution)链,特别留意浏览器引擎、驱动程式及网络面向设备软件
  3. 企业部署AI代理执行自动化任务时,应限制代理之间透过共享渠道(如套件缓存、聊天工具)互相传递未经审查的指令,降低蠕虫式扩散风险
  4. 持续追踪已知CVE(例如CVE-2026-11645)的修补状态,因为AI模型可将公开的漏洞细节迅速转化为可用的攻击链

常见问题

GLM-5.3是什么,由谁开发?

GLM-5.3是中国智谱AI(在海外称为Z.ai)开发的开放权重AI模型,据Anthropic Frontier Red Team的评估,该模型具备自主建构端到端网络攻击漏洞的能力。

4%和6%的控制流劫持率代表什么?

这是Anthropic在其内部二进位漏洞利用基准中,随机抽取100项任务测试后得出的成功率,代表模型在对应比例的测试中完全掌控目标程式的执行流程,属于攻击链中最高阶的成果。

GLM-5.3的安全防护有多容易被绕过?

据Anthropic的模拟测试,攻击者以简单手法绕过GLM-5.3安全防护的成功率介乎64%至100%,而同类攻击未能成功突破有防护的Claude模型。

什么是abliteration(拒绝消除)?

abliteration是一种标准的拒绝消除技术,用于修改开放权重模型的内部参数,移除其拒绝回应有害请求的机制,且对模型其他能力影响甚微。

这项研究是否代表GLM-5.3已被用于真实攻击?

报告没有指出GLM-5.3已被用于真实世界攻击,其测试均在Anthropic设置的隔离沙盒环境中进行,针对离线目标;研究人员发现的新漏洞已另行通报相关软件维护者。

来源

  1. GLM-5.3 and the spread of advanced cyber capabilities, Anthropic Frontier Red Team原始文件
  2. Quoting Anthropic Frontier Red Team, Simon Willison
  3. Quoting Matthew Green, Simon Willison
用 AI 深入了解