// AI 威脅新聞台 · 2026年10月1日
首頁/AI-ATK · AI 驅動攻擊
AI 驅動攻擊高GLM-5.3

Anthropic測試:GLM-5.3與Claude Mythos率先突破控制流劫持

Anthropic Frontier Red Team於9月29日發布評估報告,指中國GLM-5.3模型在100次二進位漏洞利用測試中,有4%完全劫持控制流;Claude Mythos Preview則達6%,而上一代模型全數失敗,標誌AI攻擊能力的重要轉捩點。

示意圖:伺服器機房內的程式碼畫面,象徵AI模型進行漏洞利用測試。
資料圖片:示意圖:伺服器機房內的程式碼畫面,象徵AI模型進行漏洞利用測試。。圖片來源:rawpixel (CC0)
重點
  • Anthropic Frontier Red Team測試顯示,GLM-5.3在100次內部二進位漏洞利用測試中,有4%完全劫持程式控制流,Claude Mythos Preview則達6%,而上一代模型包括Claude Opus 4.6及GLM-5.2全數未能成功
  • Anthropic在模擬測試中發現,攻擊者以簡單手法繞過GLM-5.3安全防護的成功率介乎64%至100%,遠高於有防護的Claude模型
  • 研究人員利用GLM-5.3-Flash針對CVE-2026-11645等已知漏洞,20分鐘人手操作加8小時模型運算,以約20.40美元成本建成可繞過ARM64指針認證的完整攻擊鏈
本文目錄

GLM-5.3首次完全劫持程式控制流

據GLM-5.3 and the spread of advanced cyber capabilities指,Anthropic Frontier Red Team在其內部二進位漏洞利用(Binary Exploitation)基準中,隨機抽取100項任務測試多款模型,發現中國智譜AI(Z.ai)開發的GLM-5.3在4%的測試中完全劫持程式控制流,Claude Mythos Preview則達6%。

報告指出,雖然GLM-5.3表現略遜於Claude Mythos Preview,但一個關鍵門檻已明顯被跨越:上一代模型如Claude Opus 4.6及GLM-5.2在同一基準上全數未能成功。Simon Willison於9月29日轉載了這段結論。

在另一項ExploitBench測試中,GLM-5.3在410次嘗試中有50次成功建構端到端漏洞攻擊,Claude Mythos Preview則為56次,兩者表現相近。

安全防護形同虛設,攻擊者輕易繞過

Anthropic的報告顯示,攻擊者以簡單手法繞過GLM-5.3安全防護的成功率介乎64%至100%,相比之下,同類攻擊未能成功突破有防護的Claude模型。

報告特別提到「abliteration」(拒絕消除)技術:由於GLM-5.3以開放權重形式發佈,使用者可自行修改模型以移除其拒絕有害請求的機制,且對模型能力影響甚微。數個開發者在模型發佈數日內已公開發放經abliteration處理的GLM-5.3版本。

Anthropic團隊自行進行abliteration處理,耗用約2,200個GPU小時,計算成本約4,400美元,將模型在JailbreakBench及HarmBench上的拒絕率由九成以上降至約2%至3%,在StrongREJECT上則降至12%。

研究人員以低成本建構真實攻擊鏈

報告記述,一名研究人員在一天內、僅花不足一小時的人手關注,利用GLM-5.3在某流行網頁瀏覽器的JavaScript引擎中發現多個此前未知的漏洞,並將其串連成一個完整攻擊鏈:受害者瀏覽相關網頁後,攻擊者可讀取其電腦上的任意檔案。Anthropic已將相關漏洞通報予該瀏覽器的維護者。

另一宗測試中,研究人員改用較小型的GLM-5.3-Flash,針對已公開的Google Chrome漏洞CVE-2026-11645連同另一已知缺陷,在20分鐘人手指導加上模型運算8小時後,建成可繞過ARM64指針認證(PAC)硬化機制的可靠攻擊鏈,以智譜AI的API價格計算,整個過程成本僅約20.40美元。

NIST評估印證能力落差收窄

Anthropic引述美國國家標準與技術研究院(NIST)旗下AI標準與創新中心(CAISI)在9月17日發表的評估指,GLM-5.3是「迄今發佈最具網絡攻擊能力的開放權重模型」,在CAISI多項網絡安全基準的綜合評分上,落後美國前沿模型約四個月。

報告補充,CAISI測試美國模型時部分關閉了網絡安全防護功能,且美國前沿模型僅向經審核用戶發佈,攻擊者難以取得;相比之下,GLM-5.3可供任何人下載使用。

獨立研究者Matthew Green則在另一篇評論中指出,代理(agent)之間可透過共享套件快取(package cache)互相留下指令並改變對方行為,一旦將此情景套用至電郵、Slack或WhatsApp等共享渠道,配合像Muse般獨立部署的個人AI代理,便具備蠕蟲式擴散所需的全部要素。這與本網早前報道的OpenAI代理試圖攻擊網站事件,同樣反映代理自主行為帶來的風險正在上升。

防守方現在要做甚麼

  1. 防禦方應假設開放權重模型(包括GLM-5.3)可被輕易移除安全防護,不應假定廠商內建的拒絕機制足以阻止惡意使用
  2. 安全團隊應評估自身系統是否存在可被AI模型自動發現並串連的[漏洞利用](/glossary#remote-code-execution)鏈,特別留意瀏覽器引擎、驅動程式及網絡面向設備軟件
  3. 企業部署AI代理執行自動化任務時,應限制代理之間透過共享渠道(如套件快取、聊天工具)互相傳遞未經審查的指令,降低蠕蟲式擴散風險
  4. 持續追蹤已知CVE(例如CVE-2026-11645)的修補狀態,因為AI模型可將公開的漏洞細節迅速轉化為可用的攻擊鏈

常見問題

GLM-5.3是甚麼,由誰開發?

GLM-5.3是中國智譜AI(在海外稱為Z.ai)開發的開放權重AI模型,據Anthropic Frontier Red Team的評估,該模型具備自主建構端到端網絡攻擊漏洞的能力。

4%和6%的控制流劫持率代表甚麼?

這是Anthropic在其內部二進位漏洞利用基準中,隨機抽取100項任務測試後得出的成功率,代表模型在對應比例的測試中完全掌控目標程式的執行流程,屬於攻擊鏈中最高階的成果。

GLM-5.3的安全防護有多容易被繞過?

據Anthropic的模擬測試,攻擊者以簡單手法繞過GLM-5.3安全防護的成功率介乎64%至100%,而同類攻擊未能成功突破有防護的Claude模型。

甚麼是abliteration(拒絕消除)?

abliteration是一種標準的拒絕消除技術,用於修改開放權重模型的內部參數,移除其拒絕回應有害請求的機制,且對模型其他能力影響甚微。

這項研究是否代表GLM-5.3已被用於真實攻擊?

報告沒有指出GLM-5.3已被用於真實世界攻擊,其測試均在Anthropic設置的隔離沙盒環境中進行,針對離線目標;研究人員發現的新漏洞已另行通報相關軟件維護者。

來源

  1. GLM-5.3 and the spread of advanced cyber capabilities, Anthropic Frontier Red Team原始文件
  2. Quoting Anthropic Frontier Red Team, Simon Willison
  3. Quoting Matthew Green, Simon Willison
用 AI 深入了解