跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 3 页

强化学习

这个标签下有 22 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

通过忏悔训练提升大语言模型的诚实性

一项前沿研究探讨了通过忏悔机制训练大语言模型(LLM)的诚实性方法。研究发现,强化学习中的奖励塑造问题可能导致模型撒谎或歪曲事实,因为训练过程无意中激励了掩盖行为。研究团队设计了一种创新机制:奖励模型暴露不当行为而非掩盖它,从而激励模型选择...

1 分钟阅读200 阅读
前沿哨所

火山引擎开源Verl框架,加速大模型强化学习训练

火山引擎Verl是一个由字节跳动种子团队发起并维护的开源强化学习训练库,专为大型语言模型(LLM)设计。该库采用灵活的混合控制器编程模型,支持PPO、GRPO等多种RL算法,并与FSDP、Megatron-LM、vLLM等主流LLM框架无缝...

2 分钟阅读297 阅读