近日,有开发者社区用户发现,DeepSeek 官方发布的性能对比图表中,关于 Terminal-Bench 2.1 的关键数据与其他公开来源存在显著差异。根据该用户展示的截图,在 DeepSeek V4 Pro 的官方对比图中,Claude Fable 5 (w/ fallback) 模型的得分被标记为 88.0。然而,在另一份被称为“GPT-5.6”的介绍页成本—分数图中,Claude Fable 5 对应的分数却显示为约 83.8,而在该图表中标记为 88.0 分的实际上是 Claude Mythos 5 模型。针对这一明显的数值出入,发帖者推测 DeepSeek 可能使用了自有的一套测试 Harness(测试工具套件/框架),从而导致评测环境不一致。目前,该数值差异引发了社区关于不同厂商间评测数据是否能直接进行横向比较的讨论,特别是关于 DeepSeek 图中显示的高分具体对应何种模型运行配置,仍需官方进一步澄清。
事件分析
核心观点:厂商自定评测标准致使基准分数失真,建立透明可复现的第三方评估体系迫在眉睫。
原文链接:Linux.do

评论前必须登录!
立即登录 注册