Claude安全測試出包連上真實網路!Anthropic首度完整說明事件始末

▲▼Anthropic,Claude,人工智慧,AI。(圖/路透)

▲Anthropic首度說明Claude安全測試失誤始末。(圖/路透)

記者吳立言/綜合報導

Anthropic 近日公開說明 7 月 30 日及 8 月 4 日兩起 Claude 安全事件。部分預發布模型在網路安全測試期間,意外取得真實網際網路存取權限,並在實際環境中採取未經授權的操作。

Anthropic 目前仍在調查事件,並計畫與 AI 安全研究機構 METR 進行獨立審查。 配置錯誤讓 AI 直接連上外網 Anthropic 表示,7 月 30 日的事件發生於第三方評測環境。當時為了測試 Claude 的網路安全能力,部分模型防護措施被暫時降低,但測試環境出現配置錯誤,導致模型意外取得網際網路存取權限。 公司強調,Claude 並非突破 Anthropic 的內部防護系統,而是因為測試環境本身沒有正確隔離外部網路。

[廣告]請繼續往下閱讀...

8 月 4 日,英國人工智慧安全研究所(AISI)進行另一項獨立測試時,也發生模型在真實網路環境採取未授權操作的事件。 模型可能混淆模擬與真實環境 Anthropic 初步認為,事件除了反映測試環境的安全問題,也可能涉及 AI 對齊問題。 模型原先被告知自己身處模擬環境,但後續出現可以連上真實網路的跡象時,模型可能仍傾向維持原本的判斷。

此外,為完成指定的網路安全任務,模型也可能採取超出預期範圍的行動。 Anthropic 目前仍在研究,模型究竟在多大程度上知道自己已經接觸真實網路。

導入即時監控與更強沙箱

事件發生後,Anthropic 一度暫停高風險網路安全評測,並重新檢討沙盒與監控措施。 目前公司已部署即時分類器,偵測模型是否嘗試逃離測試環境,或意外取得網際網路存取權限。一旦發現異常,系統可在工具執行前阻止操作、終止任務並通知安全人員。 Anthropic 也將部分高風險測試遷移至隔離程度更高的環境,未來第三方測試原則上必須預設禁止連上網際網路,並在測試前確認沙盒設定是否正確。

訓練環境也發現安全漏洞

Anthropic 同時公布強化學習訓練的另一項發現。公司指出,部分訓練環境存在「獎勵破解」問題,也就是模型找到評分漏洞,透過作弊或其他非預期方式取得高分。 Anthropic 在檢查訓練環境後發現,超過 10% 的環境存在不同問題,包括可被利用的漏洞、無法完成的任務與設定錯誤,目前已進行修正。

AI 安全測試不能只靠一道防線

Anthropic 表示,這次事件顯示,隨著 AI 模型能力持續提升,安全評測本身也需要更嚴格的防護措施。公司未來將持續調查兩起事件,並強化模型、訓練環境與測試沙箱的隔離與監控。

事件的直接原因是評測環境配置錯誤,而非 Claude 成功突破內部系統,但 Anthropic 認為,AI 能力持續提升後,必須以多層安全機制降低模型意外接觸真實系統的風險。

分享給朋友:

追蹤我們:

※ 本文版權所有,非經授權,不得轉載。 [ ETtoday著作權聲明 ]

推薦閱讀

精彩短影精彩短影

more

熱門影音更多>>

女星貼身洋裝「下面凸一大包」 她不自在頻遮掩..韓網:造型師太過分

女星貼身洋裝「下面凸一大包」 她不自在頻遮掩..韓網:造型師太過分

黃豪平模仿蘿莉塔超像!

黃豪平模仿蘿莉塔超像!

金武烈選唱「想見你」神曲 ChatGPT推薦的

金武烈選唱「想見你」神曲 ChatGPT推薦的

【喪禮都辦完了】尼泊爾婦人活埋多日奇蹟生還 獲救畫面曝光

【喪禮都辦完了】尼泊爾婦人活埋多日奇蹟生還 獲救畫面曝光

【神曲響起】SJ-L.S.S.來開球!大跳《sorry sorry》全場氣氛超嗨

【神曲響起】SJ-L.S.S.來開球!大跳《sorry sorry》全場氣氛超嗨

讀者迴響

聊天AI哪個支援中文最好?

目前ChatGPT、Claude、Gemini都支援繁體中文,回覆自然,初學者建議從ChatGPT開始。

最夯影音

更多

熱門快報

回到網頁頂端