本文分享了一种直接提取大模型系统提示词的技巧,通过特定的指令诱导模型输出初始化内容。作者对ChatGPT、Claude、Gemini、豆包及美团Longcat等进行了实测。结果显示,模型防御能力参差不齐:ChatGPT几乎不设防;豆包在中文语境下比英文更容易泄露;部分模型虽有拦截机制,但仍可利用角色扮演或语言混淆绕过。这一实验揭示了当前大模型在指令遵循与安全合规之间的脆弱平衡。
实测多种大模型系统提示词破解:ChatGPT几乎不设防,国产AI防御策略各异
未经允许不得转载:80aj » 实测多种大模型系统提示词破解:ChatGPT几乎不设防,国产AI防御策略各异







