跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
前沿哨所

DeepSeek灰度模型被指复刻Anthropic预处理机制,安全层逻辑高度相似

3 分钟阅读阅读(36)
赞助推荐 团队协作里的 AI 办公工作台

近日,有开发者在DeepSeek的灰度测试模型中发现,该模型在输入数据预处理阶段表现出了与Anthropic Claude模型高度一致的特征。根据测试记录,DeepSeek似乎完全复刻了Anthropic特有的ANTML(Anthropic Markup Language)处理机制。在ANTML机制下,Anthropic会自动过滤输入中的“标签,仅保留`<xxx`部分供模型读取,且这一过滤过程发生在模型推理前的Token计数阶段,意味着这是一种前置的硬编码过滤手段,而非模型自主学习的“脏Token”。通过对比输入Token数量的大小写无关性测试,证实了这一机制的存在。进一步的行为测试显示,当向DeepSeek灰度模型提问一个会导致模型拒绝的敏感问题时,其反应逻辑与Anthropic Opus如出一辙:模型会立即触发拒绝回答,并在回退时精准复述拒绝理由。这种从底层输入解析到顶层安全护栏的全面一致性,引发了业界对DeepSeek是否在底层架构或安全协议上直接借鉴了Anthropic技术路径的广泛关注。

事件分析

从技术架构角度分析,输入层的预处理(Preprocessing)与特定格式标签的过滤,是大模型厂商构建安全防护体系的关键一环。ANTML作为一种标记语言,本质上是在自然语言进入模型核心推理层之前设立的“检查站”,用于拦截潜在的指令注入或格式化攻击。DeepSeek灰度模型在Token计数逻辑和标签过滤行为上与Claude的高度吻合,暗示了两者在系统提示词工程或输入清洗流水线上可能存在技术趋同。这表明新兴的大模型厂商在快速迭代过程中,为了确保对抗性鲁棒性,可能参考甚至沿用了行业头部玩家已被验证的安全防御范式。这种“前置防火墙+模型对齐”的双重安全策略,正逐渐成为业界通用标准,但也引发了关于模型实现独立性及技术同质化的讨论。

核心观点:DeepSeek复刻Claude预处理逻辑,反映了国产大模型在安全护栏构建上对头部玩家的路径依赖与技术趋同。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

原文链接:Linux.do

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » DeepSeek灰度模型被指复刻Anthropic预处理机制,安全层逻辑高度相似
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型