Vetto Research发布了ProgramBench Vetted,这是一个包含50个任务的高难度基准,旨在测试AI智能体能否仅凭可运行的二进制文件和文档重建原始代码。该基准源于Meta于2026年5月发布的ProgramBench,但针对原版中严重的“失效模式”进行了根本性重构。研究发现,原版数据集中存在测试重复、环境泄露(如可调用系统中预装程序)和评分漏洞等问题,导致Agent仅输出帮助文本或包装预装程序即可通过大量测试。为此,新版本引入了一套包含Agent作为“法官”和“医生”的自动化流水线,进行多分支测试生成、去重处理、环境泄漏检查及对抗性攻击验证,确保每一分奖励都对应真实的行为重建。测试结果显示,GPT-5.5在平均奖励上领先,而Claude Opus 5在完全解决任务上表现最佳。这一研究不仅提升了AI编程能力的评估标准,也为强化学习中的奖励信号设计提供了重要参考。
事件分析
核心观点:挤掉分数“水分”:更严谨的对抗性基准是检验AI长周期推理能力而非简单记忆积累的关键。
原文链接:Hacker News

评论前必须登录!
立即登录 注册