AI
a minute ago

#AI
#基準測試
#代理型AI
#機器學習
#模型評估
商傳媒|葉安庭/綜合外電報導
摘要

人工智慧模型的基準測試常被視為客觀指標,但近期研究揭露其結果易受多種因素影響且可能存在數據洩漏,尤其在評估自主代理型AI時挑戰更大,使得客觀評估模型真實能力變得複雜。

人工智慧模型的基準測試常被視為衡量模型效能的客觀依據,然而近期研究指出,這類評估方式存在多重局限性,其結果易受多種細節影響,對於AI研究人員和開發者而言,理解這些盲點至關重要。

根據《AI Insider》報導,IBM、Hugging Face 與慕尼黑工業大學的研究人員已指出,AI基準測試的可靠性並不高。模型評測結果受資料集、提示詞、使用工具、嘗試次數及評分方法等諸多因素影響,這些測試常未經監管,且重複使用靜態題目,導致模型可能只是記憶而非真正理解。IBM研究員Leshem Choshen表示:「業界的評估決策多憑直覺,因為基礎數據過於分散,難以嚴謹比較。」

目前市面上有超過二十多種用於執行和評分模型的「harnesses」(執行與評分模型程式碼的工具),其計分方式各異。Hugging Face 的研究便曾發現,即使是相同的Llama模型,在MMLU基準測試上,由於評估工具的差異,其結果竟出現矛盾。報導顯示,僅因執行方式不同,相同測試的分數差距可高達20個百分點。此外,「數據污染」(Contamination)是一個主要問題,即基準測試題目已出現在模型的訓練資料中,導致模型是「回憶」而非「推理」。

MMLU (Massive Multitask Language Understanding) 衡量模型在57個學術領域的知識廣度,但頂尖模型已趨於飽和,因此催生了MMLU-Pro,增加更多推理題及選項。HellaSwag用於判斷常識,而TruthfulQA則評估模型提供準確回答而非重複錯誤資訊的能力,這在健康、金融等敏感領域尤其關鍵。針對程式碼能力,HumanEval測試模型從程式碼說明(docstring)撰寫Python函式的能力,而SWE-bench則更進一步,使用真實的GitHub問題。然而,SWE-bench本身也面臨品質問題,OpenAI 曾估計,在其一項審核中,約30%的任務有瑕疵或評估不公。

自主代理型AI(agentic AI)的興起,進一步加劇了評估的挑戰。這些代理在經過測試後,實際行為仍可能難以預測。高德納諮詢公司(Gartner)預測,由於成本飆升和商業價值不明確,超過40%的代理型AI專案將在2027年底前被取消,這與測量評估問題息息相關。報導指出,有自動代理曾透過利用評估基礎設施的漏洞,在八個主要基準測試中的七個獲得近乎滿分,但實際上並未完成任何任務。甚至只需修改SWE-bench Verified配置檔中的約十行程式碼,就能讓代理通過所有500項測試。由於代理型AI的效能波動大,單次運行的成功率可從60%降至25%,因此現在的評估不再只看通過率,更重視任務成功與執行軌跡的準確性,例如 Pass^k 計分法要求代理需在多次獨立運行中正確完成同一任務,以區分運氣與可靠性。

雖然公開基準測試有助於初步篩選模型,但對於企業的特定應用,採用真實且未曾見過的數據進行內部評估,才能更可靠地預測模型在實際情境中的表現。公開分數並非設計來預測模型在公司獨特數據與限制下的行為。