DeepSeek 近日在 Hugging Face 上发布的 DeepSeek-V4-Pro 模型配置引发技术社区质疑。开发者发现,目前正式版的 config.json 文件与早期预览版存在严重参数偏差。具体数据显示,Preview 版本显示其 hidden_size 为 7168,包含 61 个隐藏层和 384 个路由专家;而最新的 DeepSeek-V4-Pro-0813 正式版配置却显示 hidden_size 仅为 4096,隐藏层为 43 层,专家数为 256。经交叉比对,这套“正式版”参数规格与 DeepSeek-V4-Flash(轻量版)的配置完全一致。社区推测,DeepSeek 团队在发布正式版权重时,可能误操作直接复制了 Flash 版本的配置文件,导致 Pro 版本的实际模型架构定义与预期严重不符,这将直接影响开发者对模型的正确加载与推理部署。
事件分析
此次事件暴露了开源大模型在多版本并行维护时的工程管理挑战。DeepSeek 采取的 MoE(混合专家)架构对配置参数高度敏感,hidden_size 和层数的差异直接决定了模型的算力需求与性能上限。若配置文件与模型权重不匹配,会导致推理框架无法正确构建计算图。从发布流程看,这显然是一起低级的运维失误,而非算法逻辑缺陷。对于主打开源生态的厂商而言,模型的稳定发布和版本控制的精准度是建立开发者信任的基石,此类基础文件的错误虽易于修正,但会引发社区对官方仓库管理规范性的质疑。
核心观点:开源大模型的竞争已从算法能力延伸至工程落地,低级的配置文件失误会直接透支开发者对技术严谨性的信任。
原文链接:Linux.do