
記者吳立言/綜合報導
xAI 今(17 日)宣布,旗下影片生成模型 Grok Imagine Video 1.5 已結束預覽測試階段,正式透過 API 對外提供服務,主打更快的生成速度,以及更自然的影音同步表現。
音訊與畫面同步升級
根據 xAI 公布資訊,Grok Imagine Video 1.5 最初於 6 月初推出預覽版,支援從單張圖片生成帶有聲音的短影片。新版模型可在一次生成流程中同步產生對話、音效與環境音,並與畫面內容進行對應。官方表示,新版本也改善人物配音時的口型同步效果與語音清晰度,讓角色說話時的視覺表現更加自然,適合短影音、動畫及內容創作應用。
Grok Imagine Video 1.5 is here
— xAI (@xai) June 17, 2026
Our new image-to-video model with sharper realism, better physics and faster generations ????https://t.co/zGhs9czkC5 pic.twitter.com/9X4YicpMH8
強化動態與物理表現
除了音訊能力外,xAI 也針對影片中的動作連貫性進行優化。新版模型可減少 AI 影片常見的人物肢體變形、物體漂浮等問題,並提升重量感、慣性與加速度等物理效果的呈現。例如人物行走時衣物擺動、物體掉落軌跡等細節,都能呈現較接近真實世界的動態效果。
生成速度進一步提升
在效能方面,Grok Imagine Video 1.5 Fast 模式下,生成一段 6 秒、720p 解析度的影片約需 25 秒,相較前一代超過 40 秒的生成時間有所縮短。開發者可透過 API 上傳起始圖片、輸入動作描述,並選擇影片長度與解析度,即可使用 grok-imagine-video-1.5 模型進行生成。
