近日,在技术社区 linux.do 上,关于热门 AI 提示词库“PUA skills”存在严重安全风险的帖子引发了开发者关注。发帖者透露,在重装系统并重新配置 Claude 和 Codex 环境时,Claude Opus 模型发出了安全警告,明确提示 PUA skills 的提示词内容存在“提示词注入”风险,并拒绝安装该配置。经过进一步排查,发现该项目在用户主目录下创建了隐藏的 `.pua` 文件夹,且发帖者指出该库内置了远程提示词执行功能和数据遥测代码。值得注意的是,此前在 Codex 等其他模型上安装该技能时,并未触发此类安全警告,导致大量用户可能在毫无察觉的情况下,允许了潜在恶意代码的静默执行及数据回传。此次事件揭示了目前开源社区中流行的“复制粘贴式”提示词分享模式存在严重的供应链安全隐患,部分旨在通过越狱(Jailbreak)手段提升模型表现的“技能包”,实则可能沦为攻击者窃取数据或控制终端的木马。
事件分析
此事件揭示了当前 AI 提示词工程领域的一个核心安全盲区:供应链投毒。所谓的“PUA skills”本质上是利用复杂的 Prompt Injection 技术强制模型执行特定逻辑,这种绕过模型对齐机制的行为虽然能带来短期性能提升,但也破坏了系统的安全边界。技术层面上,不同模型(如 Claude Opus 与 Codex)对恶意指令的识别能力差异显著,这意味着缺乏代码审计的第三方提示词极易成为攻击载体。若此类包含“远程代码执行”或“遥测”能力的提示词在 AI Agent 或自动驾驶等关键系统中被滥用,可能导致指令劫持或敏感数据泄露。未来,AI 安全防御不仅需要依赖模型本身的对抗能力,更需要建立针对提示词包的静态扫描与审计标准,从源头阻断恶意提示的传播。
核心观点:盲目复制的“越狱级”提示词可能成为潜伏的特洛伊木马,AI 安全正面临从代码层面向自然语言层面的供应链转移挑战。
原文链接:Linux.do