近日,有开发者在DeepSeek的灰度测试模型中发现,该模型在输入数据预处理阶段表现出了与Anthropic Claude模型高度一致的特征。根据测试记录,DeepSeek似乎完全复刻了Anthropic特有的ANTML(Anthropic Markup Language)处理机制。在ANTML机制下,Anthropic会自动过滤输入中的“标签,仅保留`<xxx`部分供模型读取,且这一过滤过程发生在模型推理前的Token计数阶段,意味着这是一种前置的硬编码过滤手段,而非模型自主学习的“脏Token”。通过对比输入Token数量的大小写无关性测试,证实了这一机制的存在。进一步的行为测试显示,当向DeepSeek灰度模型提问一个会导致模型拒绝的敏感问题时,其反应逻辑与Anthropic Opus如出一辙:模型会立即触发拒绝回答,并在回退时精准复述拒绝理由。这种从底层输入解析到顶层安全护栏的全面一致性,引发了业界对DeepSeek是否在底层架构或安全协议上直接借鉴了Anthropic技术路径的广泛关注。
事件分析
核心观点:DeepSeek复刻Claude预处理逻辑,反映了国产大模型在安全护栏构建上对头部玩家的路径依赖与技术趋同。
原文链接:Linux.do

评论前必须登录!
立即登录 注册