跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

ICLR

这个标签下有 2 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

AI安全重大漏洞:文言文竟能100%绕过大模型防御机制

近日,ICLR相关话题讨论显示,大模型在安全性防御方面存在惊人盲区。研究表明,将恶意指令转换为文言文后,主流大模型的越狱成功率高达100%。这是因为文言文在模型训练数据中属于“低资源语言”,安全对齐机制(RLHF)主要覆盖现代主流语言,导致...

1 分钟阅读354 阅读