即時快訊
日本經濟現「混合景氣」現象:企業與消費者感受分歧 電信基礎設施獨具優勢 美國電塔公司成房產投資焦點 韓國通信聯手官方學界 全羅北道革新城市將建AI暗工廠 韓國通信推5G切片技術 助企業與政府網路安全智慧化 租霸一拖逾兩年!房東租金斷了 房貸卻照繳「欠租代償+事前辨識」成雙北新解方 FIABCI齊聚台中,從「富貴天心特區」看見台灣永續開發力 色拉布推出 Specs AI 助理與 AR 眼鏡 盤後股價回升 2% AI輔助加密幣估值受矚 實用性成價格預測關鍵 OpenAI 發表法律專用 AI 高昂成本促使法律科技更重實效 MISUMI Americas 成立 5,000 萬美元創投基金 搶攻機器人工業 AI 市場
Google Gemini Live 大幅升級:處理語音中斷、視覺與多語言更流暢
科技生活

·22 days ago·何映辰
#Google#Gemini Live#AI語音助理#多模態AI#人機互動
Google Gemini Live 大幅升級:處理語音中斷、視覺與多語言更流暢
商傳媒|何映辰/台北報導
摘要

Google 今日宣布將其 AI 語音助理 Gemini Live 大幅升級至 Gemini 3.5 Live 模型,使其在處理語音中斷、視覺內容與多語言方面更流暢,能提供更自然的互動體驗,然而其複雜的介面仍可能讓使用者感到困惑。

Google 今日宣布為旗下 AI 語音助理 Gemini Live 推出重大更新,將其核心模型升級至 Gemini 3.5 Live。這次升級旨在讓 AI 助手能更自然地應對使用者需求,包括更有效地處理對話中斷、即時分析視覺內容,並支援多語言混合對話,大幅提升其互動的流暢度與反應能力。

根據《TechRadar》報導,此次更新的 Gemini 3.5 Live 模型在處理使用者對話時,即使面對中途打斷也能維持連貫性,如同與真人對話般自然。此外,它現在能即時處理視覺資訊,讓 AI 不僅能聽懂指令,還能理解並回應畫面上的內容。例如,在 macOS 版的 Gemini 應用程式中,使用者可透過語音指令,結合螢幕內容來總結本機檔案、在不同應用程式間轉換文字,或是在游標位置生成圖片。新模型同時具備即時混合多語言的能力,不再受限於單一語言。

Google 也同步推出兩款針對開發者的模型:Gemini 3.5 Live Experimental 與 Gemini 3.5 Transcribe。開發者可透過 Gemini API,在 Google AI Studio 和 Gemini Enterprise Agent Platform 上使用這些模型。其中,Gemini 3.5 Transcribe 已應用於 Gboard 的「Rambler」功能,能將冗長的語音輸入自動轉化為格式整齊的文字,並移除「嗯」、「啊」等贅詞。使用者隨後可透過語音修正拼寫錯誤、編輯文字或改變寫作風格。這項技術預計很快也將整合至 Chrome 瀏覽器,讓使用者能在網頁上的任何文字輸入欄位中,直接透過語音進行輸入。

然而,外媒指出,儘管 Gemini 不斷提升技術,Google 在品牌策略上仍可能讓部分使用者感到困惑。Gemini 旗下有許多獨立的功能與產品名稱,如 Spark 和 Daily Brief,它們在應用程式中以不同的圖示和導航位置呈現。這種複雜的介面可能迫使使用者在執行任務前,需先思考應使用哪個內部工具,而非直接表達他們的需求。報導引述賈斯汀·艾瑪·穆爾(Justine Moore)的觀點:「人們不希望每次需要幫助時都打開一個應用程式,他們想要一個像朋友一樣可以傳訊息的聯繫人。而 iMessage 就是黃金標準。」

這種將多個模式、工作區及專屬名稱堆疊的作法,恐讓 AI 服務變成複雜的控制面板,而非單一的數位助理。這不僅是 Google Gemini 面臨的問題,其他如 ChatGPT 和 Claude 等 AI 產品也存在類似挑戰。相較之下,蘋果(Apple)將 AI 功能整合到 Spotlight Search、照片和相機等熟悉工具的 Siri 模式,或許更容易被大眾理解。對於 AI 服務而言,一個清晰、不突兀的操作介面,與模型本身的改進同樣重要,這將是 AI 融入日常數位生活的關鍵。