請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Kwaipilot開源AI編碼代理KAT-Coder-V2.5-Dev 軟體開發效率升級

商傳媒

更新於 07月29日07:15 • 發布於 07月29日12:14 • service@sunmedia.tw (商傳媒 SUN MEDIA)
圖/示意圖

商傳媒|林昭衡/綜合外電報導

人工智慧開發商 Kwaipilot 近日推出開源的 KAT-Coder-V2.5-Dev 模型,這款混合專家(MoE)AI 編碼代理專為自動化軟體工程任務設計,在多項基準測試中展現出領先的程式開發能力,可望提升軟體開發流程的效率。

KAT-Coder-V2.5-Dev 是一款總參數達 350 億的純文字模型,每次處理 Token 時會激活 30 億個參數。它基於 Qwen3.6-35B-A3B 模型,經過 12.7 萬個範例的監督式微調(SFT)後,再進行了 10 個訓練週期的強化學習(RL)。作為一個代理工具,它能在模擬沙盒環境中執行指令、讀取程式庫檔案,並根據測試回饋迭代地解決任務,這對於需要多次工具互動和錯誤恢復的任務尤其有效。此模型採用 Apache授權條款2.0版發布,允許商業使用。

性能卓越:多項基準測試領先

KAT-Coder-V2.5-Dev 在多項軟體工程基準測試中表現突出。它在 SWE-bench Verified 基準測試中達到 69.40% 的成績,成為同級開源模型中的最佳表現者。相較於其基礎模型 Qwen3.5-35B-A3B 的 58.60%,提升了近 11 個百分點。在 SWE-bench Multilingual 測試中,該模型取得 63.00% 的分數,顯示其支援多種程式語言的能力。此外,它在 Terminal-Bench 2.1 測試中獲得 41.02% 的成績,證明其在命令列工具協調和終端互動方面的專業度;在 PinchBench 測試中則高達 93.43%,凸顯其強大的工具使用基礎。而針對特定領域問題解決的 Scicode 基準測試,它也獲得 44.20% 的成果。

挑戰與潛在限制

儘管性能亮眼,KAT-Coder-V2.5-Dev 仍面臨一些挑戰。該模型的開源版本僅限於語言模型權重,不包含視覺或多模態組件,因此無法分析螢幕截圖或視覺文件。部署此模型需要較高的硬體要求,標準配置需要 8 顆 GPU 進行張量平行(tensor parallelism)部署,目前沒有單顆 GPU 的推理選項或量化版本。此外,該模型也偶爾會生成不存在的「幻覺函式」(hallucinated functions)呼叫,且在訓練過程中若無精確的獎勵機制,可能導致模型崩潰。截至目前,其下載量僅 396 次,顯示實際應用和產品化經驗尚有限。

查看原始文章

更多理財相關文章

01

Uber Eats疊單恐違反外送專法 勞動部:查證屬實最高可連續開罰

太報
02

地政士付行員佣金掀波!金管會已對15銀行金檢 令國銀全面徹查

anue鉅亨網
03

財富翻倍不滿足!他再「貸款600萬買股」下場超慘...嘆:去紫南宮也沒用

鏡報
04

38萬股東皮繃緊!外資殺爆7金融 「這檔」4天倒貨逾11萬張最慘

自由電子報
05

川湖上半年大賺11個股本 躍台股史上第3檔萬元股

中央通訊社
06

辭銀行高層賣飲料 十年後年收百億打臉世界

NOWNEWS今日新聞
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...