Google 推出 Gemini 3.8 Live 雙模型,主打邊思考邊說話的語音代理
Google 於 15 日發表兩款全新的 Gemini 語音模型──Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking。這兩款模型鎖定語音代理(Voice Agent)與即時對話應用,強調能在對話不中斷的情況下完成工具呼叫、背景任務與多步推理,讓使用者能以更自然的方式透過語音完成複雜工作。
Google 表示,Gemini 3.8 Live 主打規模化與成本效率,結合了對話能力、流暢的語音互動以及視覺理解,非常適合高頻率、即時性的語音應用;而 Gemini 3.8 Live Extended Thinking 則針對高複雜度的任務設計,提供更強大的智慧與多步驟推理能力,並能在思考的同時進行說話,透過自然的口語提示與進度敘述來維持對話的連貫性。
這兩款模型也支援近即時的視覺輸入處理,能結合使用者所看到的內容提供回應,並能自動偵測與切換 97 種支援語言。Google 進一步指出,模型可以在背景執行 API 與工具呼叫,讓系統在回應使用者的同時,一邊完成查詢或操作,大幅提升語音助理處理複雜任務的效率。
在效能表現方面,Google 引用第三方評測指出,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 獲得 82.6 分,位居整體第一,並在 τ-Voice 與 Sierra 的 τ-Voice-banking 等代理任務基準測試中取得領先成績;同時在 Big Bench Audio 表現也達到了 97.7%。Google 表示,這些能力為開發者與企業打造更可靠、可投入生產環境的語音代理提供堅實基礎。
目前,這兩款模型已開始分階段上線。開發者可以透過 Gemini API 與 Google AI Studio 使用;企業端則先在 Gemini Enterprise 進入私有預覽階段。一般使用者方面,Gemini 3.8 Live 已在 Search Live 中推出;Gemini 3.8 Live Extended Thinking 則將進入 Gemini Live,並提供給 Google AI Pro 與 Ultra 訂閱者在 Workspace 的 Docs 中使用,同時也會開放給所有 Google AI 訂閱者在 Gmail 與 Keep 中使用。
Google releases new Gemini models built to improve conversing capabilities of voice agents
Google Launches Gemini 3.8 Live and Extended Thinking Models
Google's Gemini 3.8 Live Adds Real-Time Reasoning to Voice AI
Google Launches Gemini 3.8 Live for Smarter, Free-Flowing AI Voice Chats
(圖片來源:Google)