記者吳立言/綜合報導
獨立第三方 AI 評測平台 Tracking AI 公布最新的離線 IQ 測試結果,OpenAI 的 GPT-5.6 系列模型在防作弊的非公開題庫中獲得 136 分,成為首個在該測試中突破 130 分的大型語言模型。由於 130 分在傳統 IQ 測驗中通常被視為高智商區間,因此這項結果也引發外界對 AI 推理能力進展的關注。
防作弊離線題庫測試 GPT-5.6 領先其他模型
Tracking AI 表示,目前採用兩套 IQ 題庫進行測試,一套為公開的 Mensa Norway 類型測驗,另一套則是未公開的離線題庫,目的是降低模型因訓練資料接觸題目而影響測試結果的可能性。
此次測試中,GPT-5.6 Sol、GPT-5.6 Terra 等版本皆獲得 136 分,包含視覺版本也維持相同水準。排名其後的是 Claude 5 Fable 的 130 分,而 GPT-5.6 Luna Max 與 Claude 4.8 Opus 則落在約 117 至 123 分之間。
Tracking AI 指出,過去多款旗艦模型雖持續提升成績,但大多停留在 130 分以下,GPT-5.6 是目前首個突破此門檻的模型。
▼AI 智商離線測試。(圖/Tracking AI)

開發者分享實測 生成完整應用、修復程式 Bug
除了 IQ 測試外,多位開發者近期也分享 GPT-5.6 在實際開發工作的表現。
開發者 Amir Bohlooli 表示,在相同物理模擬提示下,GPT-5.6 Sol 能自行選擇粒子流體模擬方案,並將模擬、CSS、使用者介面與渲染整合至單一 HTML 檔案,同時完成部署,快速產生可分享的網頁。
另一位開發者 Ramanpal Singh 則利用單一句提示詞建立 RAG 客服工單系統,內容涵蓋四種使用者角色、後台管理、投訴分類及情緒分析等功能,並表示完成多個應用的成本低於其他模型。
此外,產品經理 Claire Vo 分享,她遇到難以排除的程式錯誤時,改用 GPT-5.6 Sol 後成功一次修正問題,並讓其他模型也能順利執行相關程式碼。
IQ 並非 AI 全面能力指標
儘管 GPT-5.6 在 IQ 測試創下新紀錄,不過 IQ 成績主要反映抽象推理、模式辨識與邏輯分析能力,並不能完整代表 AI 在知識正確性、工具使用、長時間任務規劃或真實工作情境中的整體表現。GPT-5.6 此次在離線 IQ 測試及開發者實測皆有亮眼表現,顯示 AI 能力正持續向更高層次發展,但其整體能力仍需透過更多真實應用場景持續驗證。









