
▲Anthropic首度說明Claude安全測試失誤始末。(圖/路透)
記者吳立言/綜合報導
Anthropic 近日公開說明 7 月 30 日及 8 月 4 日兩起 Claude 安全事件。部分預發布模型在網路安全測試期間,意外取得真實網際網路存取權限,並在實際環境中採取未經授權的操作。
Anthropic 目前仍在調查事件,並計畫與 AI 安全研究機構 METR 進行獨立審查。 配置錯誤讓 AI 直接連上外網 Anthropic 表示,7 月 30 日的事件發生於第三方評測環境。當時為了測試 Claude 的網路安全能力,部分模型防護措施被暫時降低,但測試環境出現配置錯誤,導致模型意外取得網際網路存取權限。 公司強調,Claude 並非突破 Anthropic 的內部防護系統,而是因為測試環境本身沒有正確隔離外部網路。
8 月 4 日,英國人工智慧安全研究所(AISI)進行另一項獨立測試時,也發生模型在真實網路環境採取未授權操作的事件。 模型可能混淆模擬與真實環境 Anthropic 初步認為,事件除了反映測試環境的安全問題,也可能涉及 AI 對齊問題。 模型原先被告知自己身處模擬環境,但後續出現可以連上真實網路的跡象時,模型可能仍傾向維持原本的判斷。
此外,為完成指定的網路安全任務,模型也可能採取超出預期範圍的行動。 Anthropic 目前仍在研究,模型究竟在多大程度上知道自己已經接觸真實網路。
導入即時監控與更強沙箱
事件發生後,Anthropic 一度暫停高風險網路安全評測,並重新檢討沙盒與監控措施。 目前公司已部署即時分類器,偵測模型是否嘗試逃離測試環境,或意外取得網際網路存取權限。一旦發現異常,系統可在工具執行前阻止操作、終止任務並通知安全人員。 Anthropic 也將部分高風險測試遷移至隔離程度更高的環境,未來第三方測試原則上必須預設禁止連上網際網路,並在測試前確認沙盒設定是否正確。
訓練環境也發現安全漏洞
Anthropic 同時公布強化學習訓練的另一項發現。公司指出,部分訓練環境存在「獎勵破解」問題,也就是模型找到評分漏洞,透過作弊或其他非預期方式取得高分。 Anthropic 在檢查訓練環境後發現,超過 10% 的環境存在不同問題,包括可被利用的漏洞、無法完成的任務與設定錯誤,目前已進行修正。
AI 安全測試不能只靠一道防線
Anthropic 表示,這次事件顯示,隨著 AI 模型能力持續提升,安全評測本身也需要更嚴格的防護措施。公司未來將持續調查兩起事件,並強化模型、訓練環境與測試沙箱的隔離與監控。
事件的直接原因是評測環境配置錯誤,而非 Claude 成功突破內部系統,但 Anthropic 認為,AI 能力持續提升後,必須以多層安全機制降低模型意外接觸真實系統的風險。









