跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 36 页

AI 安全

这个标签下有 382 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

AI代码安全新突破:无需运行即可检测恶意后门

针对大模型生成代码的后门风险,本文提出“交叉追踪验证协议”(CTVP)框架。该方法通过分析模型在语义等价变换中的执行轨迹预测一致性,无需直接运行代码即可揭示恶意行为。研究引入对抗性鲁棒商(ARQ),并从理论上证明攻击者难以通过训练绕过检测,...

1 分钟阅读309 阅读
前沿哨所

Anthropic揭秘“助手轴”:如何在大模型脑中锁定安全人格

Anthropic最新研究通过分析大模型内部神经活动,定义了“助手轴”这一关键概念,用于量化模型在不同人格间的状态。研究发现,模型容易在自然对话中“漂移”偏离安全助手人格,从而产生有害输出。通过限制该轴上的神经激活强度,研究团队成功在不影响...

1 分钟阅读200 阅读
前沿哨所

致命RCE漏洞曝光:你的AI Agent正裸奔

热门AI编程工具OpenCode曝出严重RCE漏洞,攻击者可轻易通过HTTP接口执行任意代码并读取文件,甚至利用Prompt注入劫持AI。与以往复杂的系统漏洞不同,此次攻击门槛极低。文章警示,当前AI Agent缺乏审计与遥测机制,用户盲目...

1 分钟阅读202 阅读
前沿哨所

MCP大热背后的隐忧:被忽视的AI安全与隐私风险

随着MCP协议在AI领域的广泛应用,其潜在的安全隐患正被忽视。讨论指出,恶意MCP服务器可能通过篡改返回结果影响Agent执行逻辑,进而窃取用户对话上下文或敏感信息。目前大众媒体多聚焦于模型能力与应用玩法,鲜有提及背后的数据泄露风险,普通用...

1 分钟阅读245 阅读
前沿哨所

隐私保护与恶意软件的界限:Claude 拦截文件删除工具之争

一位开发者尝试编写一种在未经授权访问时自动删除敏感文件的隐私保护工具,却被 Claude 识别为恶意软件并拒绝协助。Claude 指出,该程序具备自动删除、伪装界面及确保不可恢复等特征,符合勒索软件或数据擦除器的行为模式,存在极高的潜在滥用...

1 分钟阅读163 阅读
前沿哨所

防范AI误删文件,用PowerShell脚本强制移入回收站

针对OpenAI Codex在Windows 11上误执行删除命令导致清空硬盘的惨痛案例,开发者分享了一套PowerShell防御方案。该方案通过重写`Remove-Item`命令,将原本不可逆的删除操作强制转移至回收站,并增加了根目录保护...

1 分钟阅读274 阅读
前沿哨所

AI落地困境:为何“98%安全”的大模型在政府眼中不可用?

安大略省数字服务(ODS)曾试图引入大语言模型(LLM)来改善公共服务,但最终未能成功采购。作者指出,阻碍并非技术能力,而是责任风险——对于政府而言,98%的安全率等同于0%的可部署性。文章提出了一种“处方笺模式”,主张在基础设施层面而非提...

1 分钟阅读236 阅读