
Google DeepMind推出多模態AI模型EmbeddingGemma 2,專為裝置端搜尋設計,讓使用者可透過文字、圖片、聲音等多種方式,快速且私密地在手機等個人裝置上檢索影音內容,提升搜尋效率並保障用戶隱私。
Google DeepMind 近日發表了最新研發的 EmbeddingGemma 2,這是一款開放權重(open-weight)的「多模態AI模型」(一種能處理多種資訊形式,例如文字、圖片、聲音和影片的人工智慧)。此模型專為「裝置端搜尋」(直接在手機、電腦等個人裝置上進行運算處理,而非將資料傳送到雲端伺服器)而設計,讓使用者能在裝置上進行高效且注重隱私的資訊檢索。
EmbeddingGemma 2 的主要功能是將文字、圖像、影片畫面和音訊等不同類型的內容,映射到一個統一的向量空間中。這使得使用者能透過自然語言描述或提供圖片範例,在本地裝置上搜尋儲存的影音檔案,例如在數小時的錄音中找到特定影片片段,或根據語音備忘錄找出相關影片。
這款模型擁有 7.4 億個參數,並且在記憶體使用上極具效率。例如,在 Google Pixel 11 Pro 手機上,僅處理文字時只需約 191 MB 的主動記憶體,若要使用完整的多模態功能,也僅需約 567 MB。其設計宗旨為「隱私優先」,所有資料處理都在裝置本機進行,無需將個人資訊上傳至雲端,大大降低了資料外洩的風險,並減少了網路延遲,確保搜尋可在離線狀態下運作。
為了展示 EmbeddingGemma 2 的應用潛力,Google AI Edge Gallery 應用程式新增了兩項功能:Instant Media Search 和 Video Moments Finder。Instant Media Search 讓使用者能以自然語言或範例圖片,快速搜尋手機上儲存的照片與影片;而 Video Moments Finder 則能根據描述(如「孩子們的笑聲」或「狗狗接飛盤」),精準定位影片中的特定時刻,且無需先將音訊轉錄成文字。此外,針對麥金塔電腦使用者,Google 也推出實驗性的 Google AI Edge Foresight for Mac 應用程式,利用此模型來搜尋會議記錄、筆記、圖片及文件等,全部都在裝置本地處理。
開發者未來幾週內將能透過 Android 上的 ML Kit 取得 EmbeddingGemma 2,並將支援硬體加速以最佳化效能。同時,Google 也將此模型整合到 MediaPipe 開發工具中,方便開發者在 iOS、macOS、Windows、Linux 及網頁等跨平台應用程式中,建構裝置端搜尋及分類功能。
