圖/示意圖
科技生活

·2 hours ago·林昭衡
#Twelve Labs#Pegasus 1.6#物理AI#影片理解#機器人訓練
圖/示意圖
圖/示意圖
商傳媒|林昭衡/綜合外電報導
摘要

AI公司Twelve Labs於週二推出最新的Pegasus 1.6模型,這款模型能透過理解人類的第一人稱視角影片,讓物理AI與機器人學習並在現實世界中執行任務,從根本上改變機器人訓練方式,應用領域涵蓋製造與半導體產業。

人工智慧公司 Twelve Labs, Inc.(TwelveLabs)於週二宣布推出 Pegasus 1.6 模型,這款新模型旨在透過影片理解,賦予機器人與物理AI(Physical AI)在現實世界中執行任務的能力。物理AI是一種讓機器能夠在現實世界中感知、推理並執行任務的人工智慧,而 Pegasus 1.6 的目標便是協助這些應用。

Twelve Labs 的共同創辦人暨執行長 Jae Lee 表示,機器過去難以從人類執行的實體工作中學習,例如掌握物品的施力變化或意外滑落後的調整動作。Pegasus 1.6 模型的發布,讓團隊能將原始影片素材轉化為結構化且可供檢視的知識,使機器人與物理AI團隊能從實際的人類經驗中學習,而非從零開始。

Pegasus 1.6 最大的特色是首度專為理解「第一人稱視角影片(egocentric video)」而設計。這類影片是從操作者的視角拍攝,能捕捉人體行動與環境互動的細節。與傳統的遙控操作數據相比,第一人稱視角影片更容易收集與擴展,且不需要特殊的攝影機或專有硬體,只要能從操作者的角度捕捉動作和互動即可。

該模型能夠精確識別影片中的動作,將其細分為精確的時間片段,並捕捉更細微的行為細節。Pegasus 1.6 支援五種工作流程,包含動作分割與標註、稠密字幕標註、品質評分、搜尋與策展,以及同意與合規標記。這些功能讓模型能將大量影片資料轉化為機器學習所需的有效訓練數據,同時也能分析靜態圖片。

此技術擴展了 Pegasus 1.5 模型現有功能,例如時間基礎元數據(Time-Based Metadata),並改進了實體辨識能力,使機器能更一致地追蹤影片中的手部、物體和工具。透過 Pegasus 1.6,Twelve Labs 期望能與更多機器人開發商合作,擴展用於機器人訓練的數據量,尤其在靈巧操作任務,如包裝、組裝、清潔,以及半導體品質控制等專業工業應用上,這項技術將提供關鍵的影片理解能力。


在 Google 搜尋的熱門報導中優先看到商傳媒
加入為 Google 偏好來源