
▲開發者發現 ChatGPT 疑似將推出新的語音模式 。(圖/X@testingcatalog)
記者吳立言/綜合報導
OpenAI 傳出正準備為 ChatGPT 推出新一代語音互動系統「Bidi 1(Bidirectional Voice Mode)」,透過雙向語音架構讓 AI 能夠在說話的同時持續聆聽使用者,進一步提升對話自然度與上下文理解能力。
有開發者爆料,近期在部分 ChatGPT 網頁版與行動 App 中發現「Bidi 1」相關選項。該模式目前出現在語音模型設定頁面,與標準語音模式及進階語音模式並列,顯示 OpenAI 已開始進行有限範圍測試。
主打同步聆聽與回應
與現行語音模式相比,Bidi 1 最大特色在於採用雙向語音設計。過去 AI 往往需要等待使用者講完後才能開始回應,而新模式則可在回應過程中持續接收語音輸入。
開發者實際測試顯示,當使用者停頓思考時,系統會以簡短的「好」、「了解」等自然回應表示正在聆聽,而非過早打斷對話。此外,若使用者臨時改變指令內容,例如要求 AI 倒數時突然要求改成反向計數,系統也能立即調整。
改善長對話記憶問題
另一項被注意到的升級則是上下文保留能力。目前 ChatGPT 的語音模式在長時間對話後,偶爾會出現遺忘先前內容或失去脈絡的情況。測試者指出,Bidi 1 對於整段對話的記憶能力明顯提升,能夠更完整掌握先前討論內容,不必頻繁重新說明背景資訊。同時,新模式也減少了 AI 將使用者停頓誤判為發言結束的情況,讓整體互動更加流暢。
創意功能仍保留限制
在創意互動方面,Bidi 1 似乎延續了進階語音模式的部分能力,包括即興創作歌曲、模仿節奏與 Beatbox 等功能。不過在版權管理方面,系統限制較以往更加明確。測試顯示,當使用者要求演唱知名歌曲時,AI 會直接拒絕,但若要求以特定音樂風格創作原創作品,仍可正常生成內容。
從目前跡象來看,新功能可能採取逐步開放方式,先向部分 ChatGPT 用戶推出,再擴大至更多地區與平台。至於 API 支援以及 Codex 語音功能更新等後續規劃,目前仍未獲得官方證實。
