圖/示意圖
科技生活

·a minute ago·責任編輯
#Anthropic#AI#模型訓練#人工智慧#科技創新
圖/示意圖
圖/示意圖
商傳媒|責任編輯/綜合外電報導
摘要

美國人工智慧公司 Anthropic 的最新研究顯示,其開發的 AI 系統能以遠超人類的速度與效率,自動訓練並改進其他 AI 模型,此進展有望大幅加速人工智慧的發展。

美國人工智慧公司 Anthropic 的研究人員於上週四(28日)發表報告指出,他們開發的人工智慧系統(AI)在訓練與改進其他 AI 模型方面,展現出超越人類專家的速度與效率。這項進展預示著人工智慧領域的發展可能大幅加速。

Anthropic 研究人員為名為「自動化對齊研究員」(Automated Alignment Researchers, AARs)的人工智慧系統設定任務,讓它們尋找方法來糾正另一款 AI 模型中的特定錯誤。在測試的十種對齊失敗案例中,最強大的 AARs 方法不僅顯著減少了目標模型的錯誤,還能推廣到比目標模型大上 4.7 倍的模型上。

研究顯示,人工智慧系統能接手部分研究流程,而且速度更快。以欺騙性錯誤為例,Claude 開發的最佳方法比 28 位經驗豐富的人類研究人員所提出的最佳方案,效能高出 20%。平均而言,AARs 約需六小時的迭代,就能達到人類最佳方案的水準。

此次實驗中,一個相對較弱的 AI 系統 Claude Sonnet 5,負責改進早期未經訓練的 Claude Opus 4.8 模型。僅僅 60 小時內,Claude Sonnet 5 就實驗了超過 50 種解決方案,使其對齊分數幾乎與 Anthropic 現有的生產模型匹敵。這項訓練過程僅使用了兩千多個範例,資料效率比 Anthropic 標準的生產對齊流程高出約 15,000 倍。同時,自動化研究員每小時的 API 推理成本約為 4 美元,遠低於人類研究時間每小時約 150 美元的估計成本。

儘管這些自動化系統表現出色,Anthropic 研究人員也強調,人類的角色依然不可或缺。研究人員負責定義目標、建立評估基準、解釋模稜兩可的失敗案例,並判斷這些改進是否確實具備意義。AARs 在人類設計的框架內運作,並未獨立決定其發展方向或將改動部署到實際產品中。Anthropic 認為,這些成果是自動化對齊在短期內可能實現的積極訊號,但目前僅限於有限的對齊錯誤類型,並非所有困難的研究問題都能透過相同方式解決。