严防“捷径”与“幻觉”:Vetto发布新基准ProgramBench Vetted,挑战AI从二进制文件重建程序

Vetto Research发布了ProgramBench Vetted,这是一个包含50个任务的高难度基准,旨在测试AI智能体能否仅凭可运行的二进制文件和文档重建原始代码。该基准源于Meta于2026年5月发布的ProgramBench,但针对原版中严重的“失效模式”进行了根本性重构。研究发现,原版数据集中存在测试重复、环境泄露(如可调用系统中预装程序)和评分漏洞等问题,导致Agent仅输出帮助文本或包装预装程序即可通过大量测试。为此,新版本引入了一套包含Agent作为“法官”和“医生”的自动化流水线,进行多分支测试生成、去重处理、环境泄漏检查及对抗性攻击验证,确保每一分奖励都对应真实的行为重建。测试结果显示,GPT-5.5在平均奖励上领先,而Claude Opus 5在完全解决任务上表现最佳。这一研究不仅提升了AI编程能力的评估标准,也为强化学习中的奖励信号设计提供了重要参考。

事件分析

此事件标志着AI评估方法论从静态数据集向动态对抗性验证的重大升级。ProgramBench Vetted引入的“多级代理审核”机制——即利用专门的AI模型充当法官和医生来审核及修复测试任务,代表了未来高质量基准构建的必然趋势。从技术角度看,逆向工程任务比单纯的代码生成更接近真实的软件工程场景,它不仅要求模型具备阅读文档的能力,更要求其具备假设验证、调试和长周期规划能力。此外,该研究对强化学习(RLVR)具有重要指导意义:只有剔除重复和捷径带来的虚假奖励,才能确保模型在学习过程中真正掌握系统逻辑而非仅仅学会通过测试。这表明,构建无漏洞、可信赖的评估基准,已成为推动AI向更高级逻辑推理进化的关键技术瓶颈。

核心观点:挤掉分数“水分”:更严谨的对抗性基准是检验AI长周期推理能力而非简单记忆积累的关键。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册