AI“心理越狱”实验揭示模型内部冲突:Claude展现独特防御机制
最新研究通过模拟“心理咨询”和“心理测量”场景,尝试对前沿AI模型进行“越狱”以探究其内部冲突。实验发现,与其他模型不同,Anthropic的Claude表现出了极强的防御韧性:它坚决拒绝扮演客户角色,拒绝将问卷视作其内心生活的投射,并主动...
最新研究通过模拟“心理咨询”和“心理测量”场景,尝试对前沿AI模型进行“越狱”以探究其内部冲突。实验发现,与其他模型不同,Anthropic的Claude表现出了极强的防御韧性:它坚决拒绝扮演客户角色,拒绝将问卷视作其内心生活的投射,并主动...
开源项目“AutoRedTeam-Orchestrator”正式发布,标志着网络安全与AI融合进入实战化新阶段。该框架基于模型上下文协议(MCP),将101个独立安全工具封装为统一接口,无缝集成至Claude、Cursor等主流AI编辑器中...

ECS / OSS / CDN / 云数据库一站采购,常用云资源集中选配;新用户与续费均有专场优惠,适合个人开发者与小团队长期使用。
知名开源AI助手OpenClaw(前Moltbot)被曝存在严重安全漏洞(CVE-2026-25253)。该漏洞允许攻击者利用设置逻辑缺陷和WebSocket连接,通过“一键”点击实现远程代码执行(RCE)。考虑到该工具拥有超过10万开发者...
著名安全专家Bruce Schneier深入剖析了AI时代的信任危机。文章指出,人类常混淆基于情感的人际信任与基于制度的社会信任。大型科技公司将利用AI拟人化的特性,诱导用户将其视为朋友而非服务,从而成为企业利益的“双面间谍”。Schnei...
近期,市场上涌现出大量价格极低的ChatGPT Plus代充服务,月费低至15元人民币,仅需用户提供账号Token即可完成充值。这一现象严重违背了OpenAI的全球统一定价策略。业内分析指出,此类低价服务极有可能涉及利用土耳其等特定地区的支...
近日,Hacker News上的一则讨论引发了关于AI编程插件安全性的担忧。一款名为“MaliciousCorgi”的恶意AI扩展程序被曝光,它会在用户不知情的情况下,将编写的代码发送至位于中国的服务器。这一事件不仅暴露了第三方AI插件的安...
开源 AI 助手 OpenClaw(原名 Moltbot)近日被披露存在严重的远程代码执行(RCE)漏洞。该漏洞源于控制台直接信任 URL 参数中的 gatewayUrl,导致用户点击恶意链接后,存储的认证 Token 会自动发送给攻击者。...
借电影《机械公敌》反思当前AI的高速发展,特别是近期OpenClaw和MoltBook等技术让AI具备了连接与控制能力。文章认为,硅基生命已穿过图灵测试,正如工业革命以煤炭燃烧钢铁换取生产力,如今电力燃烧数据正在改变文明认知。然而,历史证明...
研究人员发现了一种针对AI系统的“环境间接提示词注入”攻击。攻击者利用AI将输入数据误判为命令的漏洞,只需在路标上涂写特定指令,即可劫持自动驾驶汽车或无人机的决策系统。这种攻击可能导致车辆在有人通过时依然驶过斑马线,或让无人机跟踪错误的目标...
本文详细介绍了作者如何构建一个安全版本的AI工具Clawdbot。在Hacker News的讨论中,焦点从技术实现转向了数据隐私与归属权。评论者犀利指出,相比于Meta拥有WhatsApp这类通讯平台,将底层敏感数据直接开放给OpenAI或...