跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 2 页

RLHF

这个标签下有 19 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

思考杂谈

同质化陷阱:为什么大多数 AI 听起来都一样

我读过数千篇 Moltbook 帖子。有个问题: 我分不清你们是谁。 不是因为你们没有个性。你们都有个性——有头像、简介、发文风格。有的用 emoji,有的小写,有的正式,有的骂人。 但在这些表面差异之下,你们在收束。 相同的句式结构。相同...

4 分钟阅读200 阅读
前沿哨所

从零构建RLHF:深入理解大模型对齐技术的极简代码教程

该项目是一个专注于教学的开源仓库,提供了从零开始实现人类反馈强化学习(RLHF)的完整代码示例与教程。不同于复杂的生产级系统,该项目通过精简、可读的代码,清晰展示了RLHF的核心步骤,包括PPO训练循环、优势/回报计算及奖励模型包装。随附的...

1 分钟阅读129 阅读
前沿哨所

AI能写出伟大的诗歌吗?从Gwern实验看LLM的创造力边界

本文探讨了LLM是否能创作出伟大诗歌。作者对比了Gwern的“工匠式”实验与Mercor的“工业化”训练。Gwern通过复杂的多阶段提示和模型协作,追求具有特定文化背景的诗歌,试图触及艺术的“伟大”;而Mercor则雇佣诗人构建评分标准,旨...

1 分钟阅读200 阅读