AI智商天花板再刷新!GPT-5.6離線測試IQ達136 比99%人類還高

記者吳立言/綜合報導

獨立第三方 AI 評測平台 Tracking AI 公布最新的離線 IQ 測試結果,OpenAI 的 GPT-5.6 系列模型在防作弊的非公開題庫中獲得 136 分,成為首個在該測試中突破 130 分的大型語言模型。由於 130 分在傳統 IQ 測驗中通常被視為高智商區間,因此這項結果也引發外界對 AI 推理能力進展的關注。

防作弊離線題庫測試 GPT-5.6 領先其他模型

Tracking AI 表示,目前採用兩套 IQ 題庫進行測試,一套為公開的 Mensa Norway 類型測驗,另一套則是未公開的離線題庫,目的是降低模型因訓練資料接觸題目而影響測試結果的可能性。

此次測試中,GPT-5.6 Sol、GPT-5.6 Terra 等版本皆獲得 136 分,包含視覺版本也維持相同水準。排名其後的是 Claude 5 Fable 的 130 分,而 GPT-5.6 Luna Max 與 Claude 4.8 Opus 則落在約 117 至 123 分之間。

[廣告]請繼續往下閱讀...

Tracking AI 指出,過去多款旗艦模型雖持續提升成績,但大多停留在 130 分以下,GPT-5.6 是目前首個突破此門檻的模型。

▼AI 智商離線測試。(圖/Tracking AI)

▲▼AI智商離線測試。(圖/Tracking AI)

開發者分享實測 生成完整應用、修復程式 Bug

除了 IQ 測試外,多位開發者近期也分享 GPT-5.6 在實際開發工作的表現。

開發者 Amir Bohlooli 表示,在相同物理模擬提示下,GPT-5.6 Sol 能自行選擇粒子流體模擬方案,並將模擬、CSS、使用者介面與渲染整合至單一 HTML 檔案,同時完成部署,快速產生可分享的網頁。

另一位開發者 Ramanpal Singh 則利用單一句提示詞建立 RAG 客服工單系統,內容涵蓋四種使用者角色、後台管理、投訴分類及情緒分析等功能,並表示完成多個應用的成本低於其他模型。

此外,產品經理 Claire Vo 分享,她遇到難以排除的程式錯誤時,改用 GPT-5.6 Sol 後成功一次修正問題,並讓其他模型也能順利執行相關程式碼。

IQ 並非 AI 全面能力指標

儘管 GPT-5.6 在 IQ 測試創下新紀錄,不過 IQ 成績主要反映抽象推理、模式辨識與邏輯分析能力,並不能完整代表 AI 在知識正確性、工具使用、長時間任務規劃或真實工作情境中的整體表現。GPT-5.6 此次在離線 IQ 測試及開發者實測皆有亮眼表現,顯示 AI 能力正持續向更高層次發展,但其整體能力仍需透過更多真實應用場景持續驗證。

分享給朋友:

追蹤我們:

※ 本文版權所有,非經授權,不得轉載。 [ ETtoday著作權聲明 ]

推薦閱讀

精彩短影精彩短影

more

熱門影音更多>>

【不是護理師!】陳幸妤再爆料 陪趙建銘出國新女友是大學生

【不是護理師!】陳幸妤再爆料 陪趙建銘出國新女友是大學生

【再度露面】陳幸妤曝趙建銘休診出國! 「跟誰去自己去查」

【再度露面】陳幸妤曝趙建銘休診出國! 「跟誰去自己去查」

【陳幸妤2度現身!】被問一人顧3孩辛苦嗎?秒回:你覺得呢

【陳幸妤2度現身!】被問一人顧3孩辛苦嗎?秒回:你覺得呢

【太派了吧】女路不熟逆闖單行道! 台中22歲超派男揮球棒怒譙

【太派了吧】女路不熟逆闖單行道! 台中22歲超派男揮球棒怒譙

【路口停讓出事】軍用吉普車遭貨櫃車轉彎 「內輪差」拖上分隔島!

【路口停讓出事】軍用吉普車遭貨櫃車轉彎 「內輪差」拖上分隔島!

讀者迴響

聊天AI哪個支援中文最好?

目前ChatGPT、Claude、Gemini都支援繁體中文,回覆自然,初學者建議從ChatGPT開始。

最夯影音

更多

熱門快報

回到網頁頂端