即時快訊
Google豪擲千萬美元購精神航空舊數據 搶攻AI訓練資產 AI重塑消費購物體驗 零售電商業者迎變革 Stellantis美國召回近85萬輛車 倒車顯影軟體異常增風險 Xos 獲美空軍合約 部署行動充電進軍國防市場 AI資安攻防戰升溫 OpenAI總裁呼籲企業以AI對抗AI 生不逢時又怎樣?葉育碩點評 00407A 逆風翻盤關鍵 前十大持股卡位資料中心爆發鏈 亞太房市資本集中優質資產 AI需求推升資料中心熱潮 生不逢時卻迎來逆轉勝!00407A佈局AI中段供應鏈 投資達人葉育碩直言「被低估」 首爾「全租」房轉「月租」加速 韓政府研議ISA改革減衝擊 2027年美國企業醫療支出將大增近8% 恐排擠員工薪資並轉嫁成本
圖/本報資料庫
AI成本
a few seconds ago

#AI成本
#Gartner
#Context Engineering
#AI代理
#推論成本
圖/本報資料庫
圖/本報資料庫
商傳媒|何映辰/台北報導
摘要

高德納諮詢公司預計AI代理的推論成本到2028年將大幅增加,主因是AI模型在處理資訊時,其「Context Window」過載導致的效能下降與Token使用量暴增;為此,企業需要透過「Context Engineering」技術,有效管理AI模型接收的資訊,以降低成本並提升效能。

全球知名的資訊科技研究顧問公司高德納諮詢公司(Gartner)已預期,人工智慧(AI)代理的推論(Inference)成本將在2028年前顯著增加。這意味著AI模型實際運行、產生結果時所需的費用,恐將對企業帶來不小的壓力。

這些能夠自主執行任務的人工智慧程式,其效能與成本關鍵在於它們處理資訊的「Context Window」(上下文視窗),即AI模型單次互動能接收和處理的資訊量。根據 Towards AI 的共同創辦人兼技術長路易斯-弗朗索瓦·布沙爾(Louis-François Bouchard)的解釋,當 Context Window 被過多不相關的資料填滿時,會導致AI模型效能下降,此現象稱為「Context Rot」(上下文腐蝕)。

Context Rot 不僅影響AI代理的回應品質,也會推高AI模型處理資訊的基本單位——Token(權杖)的使用量,進而顯著增加營運成本。為此,業界正積極推動「Context Engineering」(上下文工程),其核心在於精確決定AI模型在每次互動中應接收哪些資訊,以期在模型品質與成本效益間取得平衡。

Context Engineering 涵蓋多項策略,旨在優化Context Window 的管理。其中,「Compaction」(壓縮)技術透過觀察截斷、選擇性保留、摘要與提示壓縮等方式,將Context Window 的資訊量最小化,僅保留最相關的內容。而「Offloading」(卸載)則是將上下文資料移出即時 Context Window 之外,例如使用 retrieve augmented generation(RAG,檢索增強生成)和 GraphRAG 等技術。

另一關鍵策略是「Caching」(快取),透過運用預先計算好的快取來大幅降低成本和延遲。當上下文內容僅是增加而非轉換時,快取能有效節省重複運算所需資源。然而,若對上下文進行摘要等修改,則可能破壞快取機制,導致需重新計算而抵消節省的效益。

此外,「Progressive Disclosure」(漸進式揭露)則強調僅在AI代理需要時才載入必要的元件,而非一次性載入所有指令,這有助於更有效地管理AI技能。早期的實驗顯示,在未經壓縮或修改的情況下,保留「完整歷史」資訊通常能在記憶回溯方面提供最佳結果,並且由於快取的效益,成本更低、速度更快。

綜合來看,Context Engineering 是一門整合壓縮、記憶體管理和技能優化的全面性學科。透過仔細規劃AI模型所接收的資訊,開發者能顯著提升AI代理的效能,同時降低營運成本並改善使用者體驗,這對於企業應對日益攀升的AI運算費用至關重要。