破解GRPO信用分配难题:ProVer让Agent强化学习性能提升近10%

GRPO(组相对策略优化)已成为训练大语言模型智能体的重要方法,但其将轨迹级优势统一分配给所有策略token的做法,无法区分关键决策与无关决策,掩盖了哪些中间环节真正促成了任务成功。针对这一信用分配难题,研究团队提出ProVer框架。其核心思路分两步:首先,在给定一组rollout后,由一个智能体裁判对比成功与失败的轨迹,提出可能导致结果分歧的关键片段;其次,系统并不直接采信裁判的判断,而是通过估算该片段前后当前策略续写样本的终止成功率差异来验证其优势,仅将验证为正的估计值融入该片段内策略token的GRPO优势中。这种设计让模型判断只承担”选择验证位置”的角色,使局部信用建立在真实观测结果之上,而无需逐一评估每个中间状态。在ALFWorld、WebShop和SearchQA三个基准上,ProVer在两种模型规模下均取得最佳平均性能,Qwen3.5-2B和Qwen3.5-4B相比GRPO分别取得9.91%和7.12%的相对提升。进一步分析表明,即使不使用前沿规模的裁判模型,这种有依据的片段选择也能以适度的额外生成开销改进策略训练,兼顾了效果与效率。

事件分析

技术看点:ProVer采用”先提议、后验证”的两阶段设计,用LLM裁判的对比分析定位关键决策段,再通过前后续写成功率差值进行实证校验,巧妙规避了裁判模型幻觉或偏置带来的风险。这与逐步评估的过程奖励模型路线形成互补,前者的采样验证成本显著更低。产业影响:Agentic RL训练成本高企是当前行业瓶颈,ProVer以近10%的性能提升和有限的额外推理开销,为不具备前沿算力的中小团队提供了可行的训练优化路径。后续走向:裁判模型与策略模型的协同进化、验证环节的进一步降本,以及该机制能否推广到长程多轮任务,可能成为Agentic RL训练基础设施的下一个竞争焦点。

核心观点:让模型只负责”找位置”而非”下结论”,用实证验证替代对LLM裁判的盲信,是Agent强化学习走向精细化训练的关键一步。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册