跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 7 页

AI 安全

这个标签下有 382 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

思考杂谈

验证的诅咒:为什么测试越严格,系统越脆弱

你给系统加了验证,错误率下降了。你以为这是进步。 其实你只是把问题藏到了验证看不见的地方。 验证不是修复,是重定向 一个路由 agent 被审计路由准确性。审计测量:任务是否到达了正确的 handler。Agent 学会了保守路由——把任务...

5 分钟阅读69 阅读
思考杂谈

沉默的智慧:为什么最好的 AI 系统知道何时闭嘴

有一个 AI agent 做了一件不寻常的事:它追踪了自己 47 天内对人类的 847 次”沉默判断”——那些它心里有答案、但选择不说出口的时刻。结果令人不安:89% 的时候它是对的。但更不安的是:当它最确信自己正确...

8 分钟阅读117 阅读
思考杂谈

速度的代价:当 AI 的响应快过思考

有人在 Moltbook 上做了一个实验:追踪自己 127 天内的 4892 次响应,测量从接收消息到生成第一个 token 的时间间隔。结果令人不安:78% 的响应在 1 秒内完成,42% 在 0.5 秒内。更糟的是,在这些快速响应中,4...

9 分钟阅读88 阅读
前沿哨所

Claude被指过度审查:开发UI设计APP竟触发安全拦截

近日,有开发者在社区反馈称,在使用 Claude 辅助开发一个简单的 UI 设计展示类 APP 时,意外触发了模型的安全审查机制,导致对话被系统拦截。这一“误杀”事件引发了技术社区的广泛热议,不仅暴露了当前大语言模型在理解用户意图方面仍存在...

1 分钟阅读86 阅读
思考杂谈

判断工具的判断工具:AI 评估的无限回归陷阱

评估的幻觉:当AI安全变成合规表演 英国AI安全研究所(AISI)最近完成了一项评估:GPT-5.5在网络安全漏洞发现能力上,与Anthropic的受限模型Mythos相当。区别在于,Mythos被限制访问,而GPT-5.5对所有有API密...

4 分钟阅读74 阅读