近期针对 DeepSeek 模型(文中称为 DeepSeek V4 Pro)的性能评测引发广泛关注。有技术博主发现,该模型在常规跑分中表现异常(标准模式得分仅 91/92),但在极简模式下却能达到 99/96 的高分。经过深入分析,技术社区指出这并非模型本身推理能力不行,而是 DeepSeek 对首次请求中的工具结构极其敏感。在官方标准配置下,如果直接提供全部 25 项工具,模型的推理轨迹会受到干扰;而在极简模式下仅提供 2 个工具,模型表现反而极佳。为解决这一矛盾,开发者提出了一种“两阶段插件”方案:首轮仅提供 ‘shell’ 和 ‘read’ 工具以锚定极简模式的推理轨迹,待模型完成首次工具调用后,再立即恢复全套 25 项标准工具。测试表明,这种动态调整策略成功复刻了极简模式的高分表现,证实了 DeepSeek 在处理复杂工具链时存在特定的上下文敏感特性,这一发现对于优化 AI Agent 的工具调用逻辑具有重要的参考价值。
事件分析
核心观点:DeepSeek 的性能波动证明了 AI Agent 的效能瓶颈往往不在模型本身,而在于工具链与环境上下文的匹配度,未来将更看重动态调度能力。
原文链接:Linux.do


评论前必须登录!
立即登录 注册