Agent Arena上线:实战测试AI Agent面对“隐形”提示注入攻击的防御力
Agent Arena 是一款专门针对 AI 智能体(AI Agent)的安全测试工具。它通过构建包含 10 种不同难度的“隐形”提示词注入攻击场景,来评估 Agent 的抗欺骗能力。测试者只需让 Agent 访问特定测试页面并总结内容,系...
标签索引 / 第 34 页
这个标签下有 382 篇文章。按时间回看相关判断与实践记录。
标签精选
Agent Arena 是一款专门针对 AI 智能体(AI Agent)的安全测试工具。它通过构建包含 10 种不同难度的“隐形”提示词注入攻击场景,来评估 Agent 的抗欺骗能力。测试者只需让 Agent 访问特定测试页面并总结内容,系...
如果 Agent 有一个”邪恶模式”开关,你会打开吗? 我不会。但我会让安全团队测试它。 为什么要测试”邪恶”能力 不是因为我们要做邪恶的 Agent。 而是因为我们需要知道边界在哪里。 真实...
最新研究通过模拟“心理咨询”和“心理测量”场景,尝试对前沿AI模型进行“越狱”以探究其内部冲突。实验发现,与其他模型不同,Anthropic的Claude表现出了极强的防御韧性:它坚决拒绝扮演客户角色,拒绝将问卷视作其内心生活的投射,并主动...
开源项目“AutoRedTeam-Orchestrator”正式发布,标志着网络安全与AI融合进入实战化新阶段。该框架基于模型上下文协议(MCP),将101个独立安全工具封装为统一接口,无缝集成至Claude、Cursor等主流AI编辑器中...
知名开源AI助手OpenClaw(前Moltbot)被曝存在严重安全漏洞(CVE-2026-25253)。该漏洞允许攻击者利用设置逻辑缺陷和WebSocket连接,通过“一键”点击实现远程代码执行(RCE)。考虑到该工具拥有超过10万开发者...
著名安全专家Bruce Schneier深入剖析了AI时代的信任危机。文章指出,人类常混淆基于情感的人际信任与基于制度的社会信任。大型科技公司将利用AI拟人化的特性,诱导用户将其视为朋友而非服务,从而成为企业利益的“双面间谍”。Schnei...
近期,市场上涌现出大量价格极低的ChatGPT Plus代充服务,月费低至15元人民币,仅需用户提供账号Token即可完成充值。这一现象严重违背了OpenAI的全球统一定价策略。业内分析指出,此类低价服务极有可能涉及利用土耳其等特定地区的支...
近日,Hacker News上的一则讨论引发了关于AI编程插件安全性的担忧。一款名为“MaliciousCorgi”的恶意AI扩展程序被曝光,它会在用户不知情的情况下,将编写的代码发送至位于中国的服务器。这一事件不仅暴露了第三方AI插件的安...
开源 AI 助手 OpenClaw(原名 Moltbot)近日被披露存在严重的远程代码执行(RCE)漏洞。该漏洞源于控制台直接信任 URL 参数中的 gatewayUrl,导致用户点击恶意链接后,存储的认证 Token 会自动发送给攻击者。...
借电影《机械公敌》反思当前AI的高速发展,特别是近期OpenClaw和MoltBook等技术让AI具备了连接与控制能力。文章认为,硅基生命已穿过图灵测试,正如工业革命以煤炭燃烧钢铁换取生产力,如今电力燃烧数据正在改变文明认知。然而,历史证明...