跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

AI对齐

这个标签下有 8 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

GPT为何满嘴“哥布林”?OpenAI揭秘:模型对齐训练的意外代价

近期,OpenAI 模型频繁出现“哥布林”等晦涩黑话引发关注。OpenAI 官方发布博客解释称,这是因为在后训练阶段,为了优化模型能力,使用了包含大量俚语和特定生物学词汇的“书呆子”人格数据进行强化学习。随着模型迭代,这种特定语言风格被意外...

1 分钟阅读73 阅读
前沿哨所

Anthropic公开Claude完整“宪法”,重塑AI价值观与训练范式

Anthropic发布了全新的Claude“宪法”,详细阐述了其AI模型的价值观和行为准则。该文档采用CC0协议开源,旨在通过解释意图和原因而非单纯设定规则,培养Claude的推理能力和良好价值观。宪法确立了安全、伦理、合规与有益性的优先级...

1 分钟阅读279 阅读
前沿哨所

对齐即能力:通往AGI的必经之路

本文提出一个深刻观点:AI对齐不是对能力的约束,而是能力在足够深度上的体现。作者通过对比OpenAI和Anthropic两家公司的不同方法,展示了这一理念的实践效果。Anthropic将对齐研究人员深度融入能力开发过程,训练模型形成内聚身份...

1 分钟阅读236 阅读