前沿哨所 AI新漏洞:'双言'攻击劫持语言模型表示 研究团队提出了一种针对大型语言模型(LLMs)的新型攻击方法’Doublespeak’。该攻击通过在上下文示例中系统地将有害关键词(如’炸弹’)替换为无害标记(如’胡萝卜̵... 2025-12-291 分钟阅读210 阅读