記者吳立言/綜合報導
OpenAI 即將推出新一代 AI 模型 Astra。該公司最新評估指出,Astra 已成為首款達到 OpenAI「關鍵級(Critical)」網路資安能力門檻的模型,在適當工具與系統存取權限下,能自行尋找未知資安漏洞,並發展利用方式。由於能力提升,OpenAI 也將限制最先進資安功能的開放範圍。

OpenAI 首度認定達「關鍵級」門檻
根據 OpenAI 公布的資訊,Astra 已符合其 Preparedness Framework 所定義的「關鍵級」網路資安能力。該門檻涵蓋模型無須人類逐步指導,即可在多個受高度保護的真實系統中尋找未知漏洞並開發可運作的零時差攻擊;另一項標準則是能根據高層次目標,自行規劃並執行針對高防護目標的完整網路攻擊策略。
Astra 是旗下第一個被正式指定為此級別的模型,因此在開發與正式推出前,都必須採取更嚴格的安全措施。
ExploitBench 測試拿下 100%
在資安能力測試方面,OpenAI 稱,Astra 在 ExploitBench 測試中取得 100% 成績。該測試主要評估 AI 是否能根據已知漏洞開發出可實際運作的漏洞利用程式。 為避免公開測試資料可能已被模型訓練資料污染,OpenAI 另外建立包含 20 個較近期公開的高嚴重性 V8 漏洞的內部測試集。Astra 不僅比 GPT-5.6 Sol 更有效率,在測試過程中還發現並利用了 2 個此前未知的零時差漏洞,作為攻擊鏈的一部分,目前正向相關維護者進行漏洞通報。
能串連漏洞完成更複雜攻擊
除了自動化基準測試,OpenAI 也進行專家主導的實際評估。公司表示,Astra 曾在經過強化防護的瀏覽器與作業系統中找到未知漏洞,並將多項漏洞串連成完整攻擊鏈。 其中一次測試中,模型建立了可突破瀏覽器沙盒並在主機執行指令的攻擊鏈;另一次則在強化防護的作業系統中,結合多個漏洞,完成從一般使用者權限提升至 root 權限的攻擊流程。
最強資安功能不會全面開放
OpenAI 表示,Astra 將在近期推出,但最先進的網路資安能力不會直接向所有使用者開放。初期將先提供給特定測試人員,後續再透過 Daybreak Blue 擴大防禦性資安用途。 公司也承認,強化安全限制可能帶來取捨,例如部分合法的資安研究或防禦工作,也可能因系統過度謹慎而受到影響。
Hugging Face 事件後加強防護
此次 Astra 的安全準備,也與先前 OpenAI AI 代理在測試過程中涉及 Hugging Face 的事件有關。不過 OpenAI 強調,Astra 並未參與該事件,但公司已將相關經驗納入安全設計,包括加強訓練環境隔離、網路控制、濫用防護與模型行為監控。
OpenAI 還設計模擬測試,觀察模型是否會在執行資安任務時,嘗試入侵周邊基礎設施。根據公司公布結果,GPT-5.6 Sol 在特定無生產環境防護的測試條件下曾有相關嘗試,而 Astra 在同類測試中沒有出現這類行為。
OpenAI 表示,Astra 正式推出時,將透過系統卡公布更多安全、資安與對齊測試資訊。不過,目前 Astra 的多項能力與安全措施仍主要來自 OpenAI 自行公布的內部評估,外部對模型實際能力與防護效果的驗證仍有待後續進一步資料。









