字节跳动Seed团队与清华大学AIR研究所联合开源了大模型强化学习系统DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization,解耦裁剪与动态采样策略优化),完整开放算法、代码基础设施与训练数据集,旨在让研究社区真正用上可扩展的强化学习技术。在核心成绩上,DAPO基于Qwen2.5-32B基础模型训练,在AIME 2024数学竞赛评测中取得50分,训练步数仅为此前最先进模型DeepSeek-R1-Zero-Qwen-32B的一半。项目于2025年5月更新了完整的wandb训练记录、模型检查点及AIME 2024评测指南,3月发布的早期版本(不含Token级策略梯度损失与动态采样)成绩为44分。训练过程展现出良好稳定性:响应长度稳步增长,为模型探索更复杂推理行为提供空间;奖励信号平稳上升,表明模型成功拟合训练分布;熵值在初期下降后可控回升,在探索与利用之间保持平衡。项目同步开源了包含17000条数学题的DAPO-Math-17k训练集,提供开箱即用的训练复现脚本,模型权重DAPO-Qwen-32B已发布。该系统基于verl框架构建,实验在火山引擎机器学习平台上完成,后续将提供完整复现指南。
事件分析
核心观点:大模型竞争正从权重开源升级为训练配方开源,可复现性正成为争夺开发者生态的新筹码。
原文链接:Hacker News




评论前必须登录!
立即登录 注册