即時快訊
台灣機能服飾登上倫敦時裝週!台南設計品牌融合高機能布料與東方美學 凍甲反覆疼痛怎麼辦?從指甲狀況到足部受力 皮膚科提醒先釐清原因 中秋過後罪惡感爆棚?網推一神器不怕狀態失守 韓國東江大學深耕 AI 教育 借鏡臺灣經驗培育「超級技師」人才 AI代理程式Hark Pro問世 鎖定隱私需求挑戰Meta Muse 川普施壓韓國 須向美國造船業投資1500億美元換關稅優惠 台南平實特區「寳實二代」30天熱銷102戶、創最高單價68.9萬 價量齊揚! CoCo都可新品「蘋」什麼這麼好喝!富士蘋果遇上烏龍茶與美式就是圈粉無數! 麥當勞AI定價工具引壟斷爭議 遭美國消費者控告 AI 助攻批判性思考 美學者建議:讓 AI 提出異議提升職場決策
圖/示意圖
科技生活

·2 hours ago·林昭衡
#人工智慧#多模態AI#Google DeepMind#裝置端AI#EmbeddingGemma 2
圖/示意圖
圖/示意圖
商傳媒|林昭衡/綜合外電報導
摘要

Google DeepMind推出多模態AI模型EmbeddingGemma 2,專為裝置端搜尋設計,讓使用者可透過文字、圖片、聲音等多種方式,快速且私密地在手機等個人裝置上檢索影音內容,提升搜尋效率並保障用戶隱私。

Google DeepMind 近日發表了最新研發的 EmbeddingGemma 2,這是一款開放權重(open-weight)的「多模態AI模型」(一種能處理多種資訊形式,例如文字、圖片、聲音和影片的人工智慧)。此模型專為「裝置端搜尋」(直接在手機、電腦等個人裝置上進行運算處理,而非將資料傳送到雲端伺服器)而設計,讓使用者能在裝置上進行高效且注重隱私的資訊檢索。

EmbeddingGemma 2 的主要功能是將文字、圖像、影片畫面和音訊等不同類型的內容,映射到一個統一的向量空間中。這使得使用者能透過自然語言描述或提供圖片範例,在本地裝置上搜尋儲存的影音檔案,例如在數小時的錄音中找到特定影片片段,或根據語音備忘錄找出相關影片。

這款模型擁有 7.4 億個參數,並且在記憶體使用上極具效率。例如,在 Google Pixel 11 Pro 手機上,僅處理文字時只需約 191 MB 的主動記憶體,若要使用完整的多模態功能,也僅需約 567 MB。其設計宗旨為「隱私優先」,所有資料處理都在裝置本機進行,無需將個人資訊上傳至雲端,大大降低了資料外洩的風險,並減少了網路延遲,確保搜尋可在離線狀態下運作。

為了展示 EmbeddingGemma 2 的應用潛力,Google AI Edge Gallery 應用程式新增了兩項功能:Instant Media Search 和 Video Moments Finder。Instant Media Search 讓使用者能以自然語言或範例圖片,快速搜尋手機上儲存的照片與影片;而 Video Moments Finder 則能根據描述(如「孩子們的笑聲」或「狗狗接飛盤」),精準定位影片中的特定時刻,且無需先將音訊轉錄成文字。此外,針對麥金塔電腦使用者,Google 也推出實驗性的 Google AI Edge Foresight for Mac 應用程式,利用此模型來搜尋會議記錄、筆記、圖片及文件等,全部都在裝置本地處理。

開發者未來幾週內將能透過 Android 上的 ML Kit 取得 EmbeddingGemma 2,並將支援硬體加速以最佳化效能。同時,Google 也將此模型整合到 MediaPipe 開發工具中,方便開發者在 iOS、macOS、Windows、Linux 及網頁等跨平台應用程式中,建構裝置端搜尋及分類功能。


在 Google 搜尋的熱門報導中優先看到商傳媒
加入為 Google 偏好來源