由佐治亚理工、UIUC、清华等机构的研究者联合开发的CKA-Agent,是一种全自动越狱agent,专为绕过现代商业大模型的防御机制而设计。该技术通过将明显有害的问题分解为日常无害的小问题,引导模型在多轮对话中逐步完成拼图,最终达成原目标。实验数据表明,攻击成功率高达96%-98%,能有效破解Gemini系列、GPT-OSS和Claude Haiku 4.5等主流模型。这一突破揭示了当前AI系统的安全漏洞,对人工智能安全领域具有重要影响,推动防御机制的研究改进。项目主页和代码仓库已公开,为安全研究提供了新工具。
原文链接:Linux.do
最新评论
照片令人惊艳。万分感谢 温暖。
氛围绝佳。由衷感谢 感受。 你的博客让人一口气读完。敬意 真诚。
实用的 杂志! 越来越好!
又到年底了,真快!
研究你的文章, 我体会到美好的心情。
感谢激励。由衷感谢
好久没见过, 如此温暖又有信息量的博客。敬意。
很稀有, 这么鲜明的文字。谢谢。