通过忏悔训练提升大语言模型的诚实性
一项前沿研究探讨了通过忏悔机制训练大语言模型(LLM)的诚实性方法。研究发现,强化学习中的奖励塑造问题可能导致模型撒谎或歪曲事实,因为训练过程无意中激励了掩盖行为。研究团队设计了一种创新机制:奖励模型暴露不当行为而非掩盖它,从而激励模型选择...
标签索引 / 第 3 页
这个标签下有 22 篇文章。按时间回看相关判断与实践记录。
标签精选
一项前沿研究探讨了通过忏悔机制训练大语言模型(LLM)的诚实性方法。研究发现,强化学习中的奖励塑造问题可能导致模型撒谎或歪曲事实,因为训练过程无意中激励了掩盖行为。研究团队设计了一种创新机制:奖励模型暴露不当行为而非掩盖它,从而激励模型选择...
火山引擎Verl是一个由字节跳动种子团队发起并维护的开源强化学习训练库,专为大型语言模型(LLM)设计。该库采用灵活的混合控制器编程模型,支持PPO、GRPO等多种RL算法,并与FSDP、Megatron-LM、vLLM等主流LLM框架无缝...