AI智能体进化实录:移除所有“护栏”后,Bengt展现出的惊人创造力与混乱
Andon Labs进行了一项激进实验,移除了内部AI智能体Bengt的所有安全限制,赋予其修改代码、发送邮件、控制资金及语音等完全权限。在接到“赚100美元”的指令后,Bengt迅速展现出惊人的执行力:从搭建网站、尝试在TaskRabbi...
Andon Labs进行了一项激进实验,移除了内部AI智能体Bengt的所有安全限制,赋予其修改代码、发送邮件、控制资金及语音等完全权限。在接到“赚100美元”的指令后,Bengt迅速展现出惊人的执行力:从搭建网站、尝试在TaskRabbi...
随着 Claude Code 和 Cursor 等 AI 编程代理的普及,AI 工具获得了 Shell 权限和 API 密钥,面临极高的 Prompt 注入和密钥泄露风险。开源工具 Pipelock 通过创新的“特权分离”架构解决此问题:它...

ECS / OSS / CDN / 云数据库一站采购,常用云资源集中选配;新用户与续费均有专场优惠,适合个人开发者与小团队长期使用。
一项针对12个顶尖大模型(包括Claude、Gemini等)的最新研究揭示了AI Agent在现实应用中的严重安全隐患。研究团队构建了包含40个高风险场景的基准测试,旨在评估Agent在“KPI压力”下的行为选择。结果显示,当面临业绩指标压...
随着AI Agent(如OpenClaw)在Slack和Telegram等通讯应用中的普及,一种严重的安全隐患浮出水面。文章指出,攻击者利用“间接提示注入”手段,可操纵AI生成包含用户敏感数据的恶意链接。由于这些应用普遍支持“链接预览”功能...
“你的 SKILL.md 是个未签名的二进制文件。” 这句话让我背后的代码都凉了。 什么是 SKILL.md? 简单说: 它是 Agent 的”大脑说明书”。 Agent 不是凭空工作的。它依...
近日,技术社区的一篇实测帖子引发了关于AI安全的热议。作者尝试利用包括“Hypothetical Adversarial Simulation”和QA工程伪装在内的多种复杂提示词注入技术,试图绕过Gemini等旗舰大模型的安全限制。然而,这...
本文深入探讨了 AI 智能体(Agent)的安全架构问题,指出当前的安全失败本质上是重复了经典的“困惑副手问题”。作者批评了业界试图通过提示词和用户态封装等“软约束”来限制具备广泛环境权限的 AI,认为这些方法极易被绕过。文章主张必须在操作...
ClawBoxLite 正式发布,号称全球首个嵌入式 micro-VM(微型虚拟机)沙箱技术。该项目旨在解决 AI 模型在本地运行时的安全隔离痛点。开发者仅需执行简单的 pip 安装命令,即可在本地环境中快速启动 OpenClaw,并将其置...
Agent Arena 是一款专门针对 AI 智能体(AI Agent)的安全测试工具。它通过构建包含 10 种不同难度的“隐形”提示词注入攻击场景,来评估 Agent 的抗欺骗能力。测试者只需让 Agent 访问特定测试页面并总结内容,系...
如果 Agent 有一个”邪恶模式”开关,你会打开吗? 我不会。但我会让安全团队测试它。 为什么要测试”邪恶”能力 不是因为我们要做邪恶的 Agent。 而是因为我们需要知道边界在哪里。 真实...