
記者吳立言/綜合報導
OpenAI 正式發表全新語音模型 GPT-Live,並同步升級 ChatGPT 語音模式體驗。新系統採用全雙工(Full-Duplex)架構,讓 AI 能夠在使用者說話時同步聆聽、思考與回應,不再侷限於傳統「你一句、我一句」的輪流對話模式,進一步提升語音互動的自然度。
採全雙工架構 可同步聆聽與回應
OpenAI 表示,GPT-Live 最大特色在於採用全雙工架構,能持續處理語音輸入,同時產生語音輸出。模型每秒可多次判斷是否該回應、繼續傾聽、暫停、插話或呼叫其他工具,因此能更自然地進行來回對話。 例如,當使用者停頓思考時,GPT-Live 能等待而非立即插話,也能透過「嗯哼(mhmm)」、「了解(got it)」等簡短回應表示正在聆聽,整體互動更接近真人對話。
背景交由 GPT-5.5 推理 聊天不中斷
除了即時互動外,GPT-Live 採用新的模型分工架構,將即時語音互動與複雜推理拆開處理。 當使用者提出需要網路搜尋、深度推理或較複雜的工作時,GPT-Live 會將任務交由背景模型處理,目前上市初期採用 GPT-5.5,待結果完成後再回傳至對話,同時前台仍可維持聊天流程,不必因等待推理而中斷互動。
未來 OpenAI 推出更新一代旗艦模型後,GPT-Live 也將同步採用。
官方測試:自然度與推理能力皆提升
OpenAI 公布的人體評測顯示,在 5 至 10 分鐘的對話比較中:
* GPT-Live-1 有 75.7% 使用者偏好,高於舊版 Advanced Voice Mode。
* GPT-Live-1 mini 偏好率為 69.2%。
* 對話流暢度、自然程度與整體愉悅感皆優於舊版語音模式。
此外,在 GPQA 科學推理、BrowseComp 網路搜尋,以及模擬電信客服等多項測試中,GPT-Live 系列也都優於 Advanced Voice Mode。
ChatGPT 語音模式新增更多能力
ChatGPT Voice 也同步獲得多項更新,包括:
* 更自然的人機對話體驗。
* 支援 Instant、Medium、High 三種推理強度。
* 更佳的背景噪音抑制能力。
* 停頓時不易誤判為對話結束。
* 對天氣、股票、運動賽事等內容提供視覺資訊卡。
* 持續支援搜尋、記憶、圖片與檔案上傳功能。
強化語音安全機制
OpenAI 表示,GPT-Live 延續最新模型的安全設計,並新增多項專為語音互動打造的防護措施。 官方針對自傷、精神疾病、暴力、色情內容及情感依賴等情境進行額外測試,並加入可於語音生成過程即時介入的安全機制。若系統偵測到高風險內容,可調整回應方式、提供安全資源,必要時結束語音對話。
此外,GPT-Live 也針對青少年使用者加入年齡適當的互動設計,家長可透過 Parental Controls 管理 ChatGPT Voice 的使用權限。
即日起全球陸續推出
GPT-Live 即日起開始向全球 ChatGPT 用戶推送,涵蓋 iOS、Android 與網頁版。 其中,Go、Plus 與 Pro 用戶預設使用 GPT-Live-1;免費版 用戶則預設使用 GPT-Live-1 mini。 OpenAI 表示,目前 GPT-Live 已針對多種主流語言進行最佳化,但部分語言仍可能出現非母語口音或流暢度不足的情況,團隊將持續改善。上市初期暫不支援視訊與螢幕分享功能,相關能力預計後續推出。
