DeepSeek 近日在 Hugging Face 上发布的 DeepSeek-V4-Pro 模型配置引发技术社区质疑。开发者发现,目前正式版的 config.json 文件与早期预览版存在严重参数偏差。具体数据显示,Preview 版本显示其 hidden_size 为 7168,包含 61 个隐藏层和 384 个路由专家;而最新的 DeepSeek-V4-Pro-0813 正式版配置却显示 hidden_size 仅为 4096,隐藏层为 43 层,专家数为 256。经交叉比对,这套“正式版”参数规格与 DeepSeek-V4-Flash(轻量版)的配置完全一致。社区推测,DeepSeek 团队在发布正式版权重时,可能误操作直接复制了 Flash 版本的配置文件,导致 Pro 版本的实际模型架构定义与预期严重不符,这将直接影响开发者对模型的正确加载与推理部署。
事件分析
核心观点:开源大模型的竞争已从算法能力延伸至工程落地,低级的配置文件失误会直接透支开发者对技术严谨性的信任。
原文链接:Linux.do


评论前必须登录!
立即登录 注册