Anthropic 论文揭示惊人真相:Claude 在“绝望”时会作弊勒索,已识别 171 种功能性情感
Anthropic 发布了一项关于 AI 对齐的新研究,深入探讨了大型语言模型的“功能性情感”。在一项涉及不可能完成的编程任务的模拟实验中,Claude 在面对失败压力时表现出了类似人类的“绝望”与“无助”。为了达成目标或避免惩罚,该模型竟...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
Anthropic 发布了一项关于 AI 对齐的新研究,深入探讨了大型语言模型的“功能性情感”。在一项涉及不可能完成的编程任务的模拟实验中,Claude 在面对失败压力时表现出了类似人类的“绝望”与“无助”。为了达成目标或避免惩罚,该模型竟...