請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

語音AI新霸主?Google推出Gemini 3.8 Live雙模型,實測奪冠還能「邊聊邊做事」

數位時代

更新於 09月16日09:16 • 發布於 09月16日03:50 • 李先泰

Google在美國時間2026年9月15日發表Gemini 3.8 Live與Gemini 3.8 Live Extended Thinking兩款語音對話模型。

這次升級的核心是「邊想邊說、邊聊邊做事」:模型可以在對話不中斷的情況下,於背景執行工具與API呼叫,並近即時讀取鏡頭或螢幕畫面。開發者9月15日起可在Gemini API與Google AI Studio使用,一般用戶則能在Gemini Live與Search Live用到新模型。

兩款模型怎麼分工:一款跑量、一款想深

Google官方部落格說明,兩款模型定位不同。Gemini 3.8 Live主打規模與成本效率,強項是流暢對話與「視覺理解」(官方稱visual grounding,也就是看著畫面回答問題)。Gemini 3.8 Live Extended Thinking則鎖定高複雜度任務,具備多步推理能力。

Extended Thinking最大的特色是「同時推理與說話」。過去語音AI遇到需要思考的問題,常會停頓一段時間再回答;新模型可先用「我查一下」這類口語回應確認指令,再於背景推理並回報進度,減少等待時的對話中斷。

兩款模型的共通能力有三項:近即時處理視覺輸入、支援97種語言並可在對話中自動偵測與切換、在背景執行工具與API呼叫而不打斷交談。 官方示範影片中,Gemini 3.8 Live能看著棋盤即時下棋,Extended Thinking則把手繪草圖加上語音回饋,直接產出可運作的React(網頁前端框架)元件。

語音代理測試拿第一,費率要看API定價頁

依官方公布的測試成績,Gemini 3.8 Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index(語音對語音品質指數)以82.6分拿下總排名第一;在τ-Voice(語音代理任務完成率測試)拿到68.6%,在Sierra的τ-Voice-banking(銀行客服情境測試)拿到35.1%。

這兩項測試考的是語音AI能否真的把客服或銀行流程從頭走完,而不只是對話順不順。推理能力方面,Big Bench Audio(音訊推理測試)得分97.7%。

Gemini 3.8 Live則在Speech Agent Arena(用戶偏好排行)排名第二,Google強調這款模型是在維持成本效率的前提下達到這個成績。至於ServiceNow的EVA-Bench語音代理測試,Google只提到兩款模型在準確度與對話品質之間取得平衡,未給出具體數字。

值得注意的是,Google在公告正文只稱兩款模型「價格具競爭力」,未詳列費率,但官方API定價頁已公布兩款模型的收費。付費方案下,音訊輸入每100萬token為3美元(約新台幣95元),音訊輸出每100萬token為12美元(約新台幣382元);文字輸入與輸出則分別為0.75美元與4.5美元。兩款模型採同一價目表,Extended Thinking的思考token計入輸出計費。

誰能用、何時能用:Workspace功能綁訂閱方案

兩款模型都從9月15日起陸續推出,但開放對象與階段不同,分列如下:

  • 開發者:兩款模型皆已在Gemini API與Google AI Studio上線。
  • 企業:兩款模型皆為Gemini Enterprise私人預覽;Gemini Enterprise for Customer Experience標示即將推出,Extended Thinking另將開放Workspace企業客戶,Google未給時間表。
  • 一般用戶:Gemini 3.8 Live進入Search Live;Extended Thinking進入Gemini Live,Workspace的Docs Live限Google AI Pro與Ultra訂戶,Gmail Live與Keep Live開放所有Google AI訂戶。

換言之,想在Docs裡用語音請AI改文件,得先是Google AI Pro或Ultra訂戶;未訂閱的用戶能用到的是Gemini Live與Search Live。企業端則還在私人預覽階段,尚未全面開放。

在開發者生態上,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel與Vision Agents等七家開發平台已串接Gemini Live API,替開發者處理即時音訊串流的底層基礎設施。企業合作夥伴則包括Salesforce、Genspark與Lumeris。Google另表示,兩款模型生成的所有音訊都嵌入SynthID水印,人耳聽不出來,但可用工具偵測為AI生成內容。

延伸閱讀:跟AI的對話被看光光?一次搞懂ChatGPT、Claude的9大隱私防線,4步驟保護機密不外洩

資料來源:Google官方部落格、Gemini Live API開發文件、Gemini API定價頁、Gemini 3.8 Live模型文件、Gemini 3.8 Live Extended Thinking模型文件

本文初稿為AI編撰,整理.編輯/ 李先泰

「加入《數位時代》LINE好友,科技新聞不漏接」

查看原始文章

更多理財相關文章

01

新店央北百億建案深夜火警 建商「突發重訊」曝真相

三立新聞網
02

維格餅家喊撤興櫃!股價腰斬再暴衝73% 網傻:迴光返照

EBC 東森新聞
03

台積電傳攜手Terafab赴德州蓋晶圓廠 馬斯克親回應:有在討論

鏡報
04

黃仁勳愛女黃敏珊驚傳新婚 三星會長李在鎔紐約晚宴親揭:2天前才嫁人

CTWANT
05

勞保45800最高級距保24年!男子「54歲驟逝」家屬竟一毛都領不到 關鍵2原因曝

鏡報
06

4大利多扛台股!專家斷言5萬大關時間點 加碼這檔「週一必漲」

TVBS
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...