Harness 决定上限?开源 Maka 利用 Kimi K3 反超官方 KimiCode 10%

开源项目 Maka-agent 近日发布了一份基于 Terminal-Bench 2.1 的性能对比报告,展示了在完全相同的底层模型“Kimi K3”下,不同 Agent 架构带来的显著性能差异。在与 Kimi 官方的 KimiCode CLI 对比中,Maka 实现了 69.7% 的任务通过率,领先 KimiCode 的 59.6%;在困难题目子集中,优势更是扩大至 20%。若剔除网络超时因素,仅分析按时完成的任务,Maka 的通过率达到 95.1%,远超 KimiCode 的 85.7%,逼近该基准测试的历史最高分。Maka 团队深入剖析了领先原因:首先是独特的“上下文预算剪枝”机制,在保持性能不降反升的前提下节省了约 187 万 Token;其次是采用精简的工具面与 System Prompt,避免了官方版本 20KB 产品级 Prompt 带来的噪音干扰;最后是严格基于“跑分-看 Trace-改进”的 A/B 测试迭代流程。该项目已将完整报告及代码开源,供社区验证。

事件分析

此次测试深刻揭示了 AI Agent 开发中“模型智商”与“系统工程”之间的辩证关系。Maka 的案例证明,即便在底层模型完全一致的前提下,优秀的工程架构——包括精准的上下文管理、轻量化的交互设计以及对模型特性的针对性微调——能榨取出模型更高的潜能。KimiCode 依赖的厚重 Prompt 在复杂 CLI 场景下反而引入了噪音,降低了推理质量,这说明通用 Agent 与专精场景 Agent 在设计逻辑上存在本质区别。Maka 通过 Token 剪枝在降低 41.7% 成本的同时实现了性能提升,这为当前高成本的 AI 应用指明了一条务实路径:即通过算法层面的精细优化来突破模型瓶颈。此外,Maka 采用的“Benchmark 驱动开发”模式,将终端测试分数作为代码合入的硬性指标,这种量化且严格的工程管理体系,是目前许多开源项目缺乏的,也是其能够积累微小优势并最终转化为胜势的核心原因。

💡 核心观点:模型底座决定下限,Agent 架构决定上限,工程化与 Prompt 优化带来的性能红利已不亚于模型本身的代际提升。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册