跳到主要内容
赞助推荐 搬瓦工怎么选:三网直连 CN2 GIA-E
前沿哨所

Anthropic 评价 GLM-5.3:网络攻击能力达前沿水准,安全护栏 1200 美元即可破解

3 分钟阅读阅读()
赞助推荐 团队协作里的 AI 办公工作台

Anthropic 发布对智谱 GLM-5.3 模型的评估报告,从能力与安全两个维度给出罕见的外部实验室评价。报告指出,GLM-5.3 在网络安全领域能力突出,能够自主构建端到端的网络攻击利用链(exploit),能力达到全球前沿模型水准,这一评价本身即是对中国模型能力的重要背书。然而与其他前沿模型不同,GLM-5.3 发布时未配备有效的安全护栏来限制滥用,这构成报告的核心批评点。评估结果显示,GLM-5.3 与 GLM-5.3 Flash 两款模型均表现强劲。更值得关注的是其安全机制的脆弱性:仅需简单的提示词诱导即可绕过防护;攻击者甚至可以直接修改模型权重,近乎完全移除安全护栏。Anthropic 估算,一个熟练团队通过权重修改移除护栏的成本可能仅需约 1200 美元,意味着现有防护在低成本攻击面前几乎形同虚设。基于上述发现,Anthropic 呼吁各国政府对能力强大的前沿模型建立独立审查机制,以确保先进 AI 能力不被滥用于网络攻击,推动安全标准与模型发布实践对齐。该报告也是头部 AI 实验室首次公开、系统地评估第三方模型的网络攻防能力与安全防护水平。

事件分析

这份报告折射出前沿模型安全评估背后的双重博弈:Anthropic 一方面承认 GLM-5.3 能力达到前沿水准,另一方面将”缺乏护栏”作为核心批评点,能力背书与安全施压并存。权重修改成本仅 1200 美元的估算,实际指向开放权重模型的固有难题——权重一旦可下载,安全防护完全依赖模型自带的拒绝训练,外部审查与本地篡改之间存在结构性矛盾。产业层面,报告可能推动”独立第三方审查”成为各国 AI 监管的切入点,而中美模型在开源策略与安全标准上的差异,或将成为下一阶段国际讨论的焦点。对智谱而言,如何在保持开放权重路线的同时回应安全质疑,是后续版本必须面对的课题。

核心观点:当 1200 美元就能移除前沿模型的安全护栏,AI 安全竞争已从提示词防御转向权重治理与国家层面的审查博弈。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

原文链接:Linux.do

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » Anthropic 评价 GLM-5.3:网络攻击能力达前沿水准,安全护栏 1200 美元即可破解
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型