即時快訊
前特斯拉工程師創 Aseon Labs,推自動維修艙革新自駕車後勤 美國陸軍啟動390A機器人技師編制 專精AI與自主作戰系統 加州立法禁職場AI情緒辨識工具 為勞工隱私權劃定界線 我的世界雙版本解析:Java與Bedrock功能差異助玩家選對平台 離職員工疑用AI竊客戶資料 保險諮詢公司Sequoia提告同業 佛蒙特州政府推動 AI 效率創新 運用「強力工具」精簡公共服務 日本跨境電商博覽會將登場 亞馬遜、阿里巴巴等巨頭齊聚 居家辦公遊戲雙修:七款智慧硬體優化桌上空間效率 律師事務所控告Westlaw「殺手級收購」 遏止法律科技競爭 歐洲AI發展遲滯恐流失科技人才 Brick Token執行長示警
圖/示意圖
科技生活

·2 months ago·林昭衡
#AI#開源模型#軟體工程#程式開發#Kwaipilot
圖/示意圖
圖/示意圖
商傳媒|林昭衡/綜合外電報導
摘要

AI開發商 Kwaipilot 推出開源的 KAT-Coder-V2.5-Dev 模型,這款 AI 編碼代理在多項軟體工程基準測試中表現突出,特別在複雜的程式撰寫任務上展現高效率。儘管性能優異,但其高昂的硬體需求及模型不穩定性仍是導入挑戰。

人工智慧開發商 Kwaipilot 近日推出開源的 KAT-Coder-V2.5-Dev 模型,這款混合專家(MoE)AI 編碼代理專為自動化軟體工程任務設計,在多項基準測試中展現出領先的程式開發能力,可望提升軟體開發流程的效率。

KAT-Coder-V2.5-Dev 是一款總參數達 350 億的純文字模型,每次處理 Token 時會激活 30 億個參數。它基於 Qwen3.6-35B-A3B 模型,經過 12.7 萬個範例的監督式微調(SFT)後,再進行了 10 個訓練週期的強化學習(RL)。作為一個代理工具,它能在模擬沙盒環境中執行指令、讀取程式庫檔案,並根據測試回饋迭代地解決任務,這對於需要多次工具互動和錯誤恢復的任務尤其有效。此模型採用 Apache授權條款2.0版發布,允許商業使用。

性能卓越:多項基準測試領先

KAT-Coder-V2.5-Dev 在多項軟體工程基準測試中表現突出。它在 SWE-bench Verified 基準測試中達到 69.40% 的成績,成為同級開源模型中的最佳表現者。相較於其基礎模型 Qwen3.5-35B-A3B 的 58.60%,提升了近 11 個百分點。在 SWE-bench Multilingual 測試中,該模型取得 63.00% 的分數,顯示其支援多種程式語言的能力。此外,它在 Terminal-Bench 2.1 測試中獲得 41.02% 的成績,證明其在命令列工具協調和終端互動方面的專業度;在 PinchBench 測試中則高達 93.43%,凸顯其強大的工具使用基礎。而針對特定領域問題解決的 Scicode 基準測試,它也獲得 44.20% 的成果。

挑戰與潛在限制

儘管性能亮眼,KAT-Coder-V2.5-Dev 仍面臨一些挑戰。該模型的開源版本僅限於語言模型權重,不包含視覺或多模態組件,因此無法分析螢幕截圖或視覺文件。部署此模型需要較高的硬體要求,標準配置需要 8 顆 GPU 進行張量平行(tensor parallelism)部署,目前沒有單顆 GPU 的推理選項或量化版本。此外,該模型也偶爾會生成不存在的「幻覺函式」(hallucinated functions)呼叫,且在訓練過程中若無精確的獎勵機制,可能導致模型崩潰。截至目前,其下載量僅 396 次,顯示實際應用和產品化經驗尚有限。


在 Google 搜尋的熱門報導中優先看到商傳媒
加入為 Google 偏好來源