AI安全重大漏洞:文言文竟能100%绕过大模型防御机制
近日,ICLR相关话题讨论显示,大模型在安全性防御方面存在惊人盲区。研究表明,将恶意指令转换为文言文后,主流大模型的越狱成功率高达100%。这是因为文言文在模型训练数据中属于“低资源语言”,安全对齐机制(RLHF)主要覆盖现代主流语言,导致...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
近日,ICLR相关话题讨论显示,大模型在安全性防御方面存在惊人盲区。研究表明,将恶意指令转换为文言文后,主流大模型的越狱成功率高达100%。这是因为文言文在模型训练数据中属于“低资源语言”,安全对齐机制(RLHF)主要覆盖现代主流语言,导致...