Google
2 hours ago

#Google
#Gemini Live
#AI語音助理
#多模態AI
#人機互動
商傳媒|何映辰/台北報導
摘要

Google 今日宣布將其 AI 語音助理 Gemini Live 大幅升級至 Gemini 3.5 Live 模型,使其在處理語音中斷、視覺內容與多語言方面更流暢,能提供更自然的互動體驗,然而其複雜的介面仍可能讓使用者感到困惑。

Google 今日宣布為旗下 AI 語音助理 Gemini Live 推出重大更新,將其核心模型升級至 Gemini 3.5 Live。這次升級旨在讓 AI 助手能更自然地應對使用者需求,包括更有效地處理對話中斷、即時分析視覺內容,並支援多語言混合對話,大幅提升其互動的流暢度與反應能力。

根據《TechRadar》報導,此次更新的 Gemini 3.5 Live 模型在處理使用者對話時,即使面對中途打斷也能維持連貫性,如同與真人對話般自然。此外,它現在能即時處理視覺資訊,讓 AI 不僅能聽懂指令,還能理解並回應畫面上的內容。例如,在 macOS 版的 Gemini 應用程式中,使用者可透過語音指令,結合螢幕內容來總結本機檔案、在不同應用程式間轉換文字,或是在游標位置生成圖片。新模型同時具備即時混合多語言的能力,不再受限於單一語言。

Google 也同步推出兩款針對開發者的模型:Gemini 3.5 Live Experimental 與 Gemini 3.5 Transcribe。開發者可透過 Gemini API,在 Google AI Studio 和 Gemini Enterprise Agent Platform 上使用這些模型。其中,Gemini 3.5 Transcribe 已應用於 Gboard 的「Rambler」功能,能將冗長的語音輸入自動轉化為格式整齊的文字,並移除「嗯」、「啊」等贅詞。使用者隨後可透過語音修正拼寫錯誤、編輯文字或改變寫作風格。這項技術預計很快也將整合至 Chrome 瀏覽器,讓使用者能在網頁上的任何文字輸入欄位中,直接透過語音進行輸入。

然而,外媒指出,儘管 Gemini 不斷提升技術,Google 在品牌策略上仍可能讓部分使用者感到困惑。Gemini 旗下有許多獨立的功能與產品名稱,如 Spark 和 Daily Brief,它們在應用程式中以不同的圖示和導航位置呈現。這種複雜的介面可能迫使使用者在執行任務前,需先思考應使用哪個內部工具,而非直接表達他們的需求。報導引述賈斯汀·艾瑪·穆爾(Justine Moore)的觀點:「人們不希望每次需要幫助時都打開一個應用程式,他們想要一個像朋友一樣可以傳訊息的聯繫人。而 iMessage 就是黃金標準。」

這種將多個模式、工作區及專屬名稱堆疊的作法,恐讓 AI 服務變成複雜的控制面板,而非單一的數位助理。這不僅是 Google Gemini 面臨的問題,其他如 ChatGPT 和 Claude 等 AI 產品也存在類似挑戰。相較之下,蘋果(Apple)將 AI 功能整合到 Spotlight Search、照片和相機等熟悉工具的 Siri 模式,或許更容易被大眾理解。對於 AI 服務而言,一個清晰、不突兀的操作介面,與模型本身的改進同樣重要,這將是 AI 融入日常數位生活的關鍵。