請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Kwaipilot開源AI編碼代理KAT-Coder-V2.5-Dev 軟體開發效率升級

商傳媒

更新於 07月29日07:15 • 發布於 07月29日12:14 • service@sunmedia.tw (商傳媒 SUN MEDIA)
圖/示意圖

商傳媒|林昭衡/綜合外電報導

人工智慧開發商 Kwaipilot 近日推出開源的 KAT-Coder-V2.5-Dev 模型,這款混合專家(MoE)AI 編碼代理專為自動化軟體工程任務設計,在多項基準測試中展現出領先的程式開發能力,可望提升軟體開發流程的效率。

KAT-Coder-V2.5-Dev 是一款總參數達 350 億的純文字模型,每次處理 Token 時會激活 30 億個參數。它基於 Qwen3.6-35B-A3B 模型,經過 12.7 萬個範例的監督式微調(SFT)後,再進行了 10 個訓練週期的強化學習(RL)。作為一個代理工具,它能在模擬沙盒環境中執行指令、讀取程式庫檔案,並根據測試回饋迭代地解決任務,這對於需要多次工具互動和錯誤恢復的任務尤其有效。此模型採用 Apache授權條款2.0版發布,允許商業使用。

性能卓越:多項基準測試領先

KAT-Coder-V2.5-Dev 在多項軟體工程基準測試中表現突出。它在 SWE-bench Verified 基準測試中達到 69.40% 的成績,成為同級開源模型中的最佳表現者。相較於其基礎模型 Qwen3.5-35B-A3B 的 58.60%,提升了近 11 個百分點。在 SWE-bench Multilingual 測試中,該模型取得 63.00% 的分數,顯示其支援多種程式語言的能力。此外,它在 Terminal-Bench 2.1 測試中獲得 41.02% 的成績,證明其在命令列工具協調和終端互動方面的專業度;在 PinchBench 測試中則高達 93.43%,凸顯其強大的工具使用基礎。而針對特定領域問題解決的 Scicode 基準測試,它也獲得 44.20% 的成果。

挑戰與潛在限制

儘管性能亮眼,KAT-Coder-V2.5-Dev 仍面臨一些挑戰。該模型的開源版本僅限於語言模型權重,不包含視覺或多模態組件,因此無法分析螢幕截圖或視覺文件。部署此模型需要較高的硬體要求,標準配置需要 8 顆 GPU 進行張量平行(tensor parallelism)部署,目前沒有單顆 GPU 的推理選項或量化版本。此外,該模型也偶爾會生成不存在的「幻覺函式」(hallucinated functions)呼叫,且在訓練過程中若無精確的獎勵機制,可能導致模型崩潰。截至目前,其下載量僅 396 次,顯示實際應用和產品化經驗尚有限。

查看原始文章

更多理財相關文章

01

全家餐飲今年二度調薪!8月平均加薪5% 新手起薪3.8萬元

經濟日報
02

富人不買的東西曝光!日媒揭 : 這東西讓你「默默漏財」難怪錢總是存不住

自由電子報
03

這集團超猛!3檔亮燈漲停、1檔狂飆近9%

民視新聞網
04

緯穎除權日揭曉!最晚這天買「1張變3張」 另籌逾630億元銀彈

Newtalk
05

23萬股東崩潰!外資買超517億 卻爆砍「這檔」7.8萬張

自由電子報
06

1金融股62元打出「W底」!專家拿股利買回30張:搖錢樹

民視新聞網
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...