AI研究机构Prime Intellect发布了关于“NanoGPT Speedrun Frontier”的最新基准测试报告。该研究旨在评估前沿AI模型在自主编程任务中的表现,具体任务是让AI Agent优化Andrej Karpathy的开源项目NanoGPT,以打破训练速度的记录。测试涵盖了18个模型,进行了共计153次自主运行,消耗了数十亿Tokens。测评的核心指标包括“填补人类记录差距”的百分比以及达到最佳记录所需的“代理时间”。
结果显示,不同模型在解决复杂编程挑战时的能力存在显著差异。排名第一的“Fable 5”模型(基于Claude-code)填补了人类记录81.7%的差距,是目前表现最优异的模型。紧随其后的是Opus 5(Claude系列)和Kimi K3,填补差距均在50%以上。值得注意的是,报告详细列出了各模型在不同工具链(如claude-code、prime-agent、qwen-code)下的轨迹数据,记录了每一次实验的代码输出、思考过程和错误修复尝试。尽管DeepSeek V4 Pro、Qwen3.8 Max等模型也参与了测试,但在填补差距的百分比上与顶尖模型仍有距离。该报告通过量化AI Agent在长时间、多步骤任务中的表现,为开发者选择高效的AI编程工具提供了重要的参考数据。
事件分析
产业层面,这种基于真实开源项目的Speedrun模式,正在成为评估AI Agent落地能力的全新标准。数据显示,头部模型(如Claude、Kimi)在配合专用工具(如prime-agent)时,已经能够承担起从代码编写到性能优化的全链路工作。然而,数据也揭示了高昂的推理成本,部分运行消耗了数亿Tokens,这意味着在追求高自动化水平的同时,如何平衡成本与效率仍是商业化落地的关键挑战。
核心观点:代码优化领域的实测数据表明,顶尖AI Agent已具备逼近人类专家的工程能力,软件开发的自动化门槛正在被实质性突破。
原文链接:Hacker News

评论前必须登录!
立即登录 注册