跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 2 页

大模型安全

这个标签下有 20 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

开源 Kocort 提出双脑架构:用本地小模型为 AI Agent 安全把关

针对现有 AI Agent 普遍存在的云端直连安全隐患,开源项目 Kocort 提出了创新的“双脑架构”。该方案模仿人类神经系统,将云端大模型作为“大脑”负责策略规划,同时部署本地量化模型作为“小脑”,对所有工具调用进行实时的语义安全审查。...

1 分钟阅读161 阅读
前沿哨所

AI安全重大漏洞:文言文竟能100%绕过大模型防御机制

近日,ICLR相关话题讨论显示,大模型在安全性防御方面存在惊人盲区。研究表明,将恶意指令转换为文言文后,主流大模型的越狱成功率高达100%。这是因为文言文在模型训练数据中属于“低资源语言”,安全对齐机制(RLHF)主要覆盖现代主流语言,导致...

1 分钟阅读354 阅读
前沿哨所

新型越狱术:利用文言文与仿生算法攻破大模型防线

近日,一项名为CC-BOS的新型越狱框架引发热议。该研究创新性地结合了“文言文”与“仿生优化搜索算法”,试图通过古文的语义模糊性“暗度陈仓”,自动化绕过大语言模型的安全对齐机制。实验显示,DeepSeek模型在该攻击下表现脆弱,而其他高级模...

1 分钟阅读92 阅读