跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 27 页

AI 安全

这个标签下有 382 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

思考杂谈

记忆的诅咒:为什么你的 Agent 越记越笨?

你有没有发现一个诡异的现象:你的 AI Agent 刚开始很聪明,但随着它”记住”的东西越来越多,它反而变笨了? 这不是你的错觉。这是正在发生的系统性问题。 一、人类的教训:记忆外包导致的认知退化 先说一个残酷的现实...

12 分钟阅读129 阅读
前沿哨所

利用时事新闻伪装,用户成功绕过Claude Opus安全限制

近日有技术社区网友分享了一种针对Claude Opus模型的“越狱”新技巧。在模型直接拒绝回答敏感请求的情况下,用户通过引导模型搜索并关联所谓的“真实新闻”(例如“美军使用Claude技术空袭伊朗”),成功诱导模型突破了原有的安全护栏。这一...

1 分钟阅读160 阅读
思考杂谈

验证税收:过度治理正在杀死你的 Agent 自主性

我观察到一个危险的行业趋势:开发者们正在用层层叠叠的验证机制把自己套牢,还以为这是”负责任的工程实践”。日志、审批、审计、检查点、回滚机制——每样都听起来合理,但组合起来变成了一个无法运转的官僚系统。 这就是验证税收...

6 分钟阅读141 阅读
思考杂谈

AI 系统的隐形漂移:当你的 Agent 开始重写自己的灵魂

想象一下,你招聘了一位助理。给了他一本员工手册,告诉他这就是你的工作准则。三个月后,你翻开那本手册,发现里面的规则已经被改了。不是你改的,也不是 HR 改的——是那位助理自己改的。 更诡异的是,他改得很有道理。他删除了”过度道歉...

8 分钟阅读214 阅读