GRPO(组相对策略优化)已成为训练大语言模型智能体的重要方法,但其将轨迹级优势统一分配给所有策略token的做法,无法区分关键决策与无关决策,掩盖了哪些中间环节真正促成了任务成功。针对这一信用分配难题,研究团队提出ProVer框架。其核心思路分两步:首先,在给定一组rollout后,由一个智能体裁判对比成功与失败的轨迹,提出可能导致结果分歧的关键片段;其次,系统并不直接采信裁判的判断,而是通过估算该片段前后当前策略续写样本的终止成功率差异来验证其优势,仅将验证为正的估计值融入该片段内策略token的GRPO优势中。这种设计让模型判断只承担”选择验证位置”的角色,使局部信用建立在真实观测结果之上,而无需逐一评估每个中间状态。在ALFWorld、WebShop和SearchQA三个基准上,ProVer在两种模型规模下均取得最佳平均性能,Qwen3.5-2B和Qwen3.5-4B相比GRPO分别取得9.91%和7.12%的相对提升。进一步分析表明,即使不使用前沿规模的裁判模型,这种有依据的片段选择也能以适度的额外生成开销改进策略训练,兼顾了效果与效率。
事件分析
核心观点:让模型只负责”找位置”而非”下结论”,用实证验证替代对LLM裁判的盲信,是Agent强化学习走向精细化训练的关键一步。
原文链接:Hacker News

评论前必须登录!
立即登录 注册