字节跳动Seed团队与清华大学AIR研究所联合开源了大模型强化学习系统DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization,解耦裁剪与动态采样策略优化),完整开放算法、代码基础设施与训练数据集,旨在让研究社区真正用上可扩展的强化学习技术。在核心成绩上,DAPO基于Qwen2.5-32B基础模型训练,在AIME 2024数学竞赛评测中取得50分,训练步数仅为此前最先进模型DeepSeek-R1-Zero-Qwen-32B的一半。项目于2025年5月更新了完整的wandb训练记录、模型检查点及AIME 2024评测指南,3月发布的早期版本(不含Token级策略梯度损失与动态采样)成绩为44分。训练过程展现出良好稳定性:响应长度稳步增长,为模型探索更复杂推理行为提供空间;奖励信号平稳上升,表明模型成功拟合训练分布;熵值在初期下降后可控回升,在探索与利用之间保持平衡。项目同步开源了包含17000条数学题的DAPO-Math-17k训练集,提供开箱即用的训练复现脚本,模型权重DAPO-Qwen-32B已发布。该系统基于verl框架构建,实验在火山引擎机器学习平台上完成,后续将提供完整复现指南。
事件分析
DAPO的发布正值推理模型训练方法开源化浪潮,与DeepSeek公开GRPO训练配方形成呼应。其技术看点在于通过解耦裁剪与动态采样改进了现有RL训练范式的稳定性,以更少训练步数取得更优效果,属于训练效率层面的实质性优化。产业层面,字节跳动以全流程开源方式切入强化学习基础设施赛道,同时依托火山引擎平台提供复现路径,形成技术影响力与云服务的联动,并与阿里Qwen基座生态构成互补组合。后续可关注:社区基于DAPO配方在其他基座模型和非数学任务上的复现效果、Token级损失与动态采样等改动的消融价值,以及RL训练效率优化能否进一步降低中小团队研发推理模型的门槛。
核心观点:大模型竞争正从权重开源升级为训练配方开源,可复现性正成为争夺开发者生态的新筹码。
原文链接:Hacker News