近期,DeepSeek V4 系列模型(包括 v4pro 和 flash)的性能表现引发了技术社区的深入探讨。B站 UP 主“风禾呢”发布研究指出,这两款模型内部均存在两种推理形态——“雷霆大思考”(深度推理)与“极简模式”(快速回答)。理论上,模型应依据问题难度自动选择最佳路径,但研究发现,DeepSeek 在后训练阶段意外损坏了负责中间管理的路由模块。这一故障导致模型无法正确调度,路由选择基本处于随机状态,且随着对话轮次增加,极易出现路径漂移,导致所有问题都错误地路由到单一模式。
为解决这一问题,该 UP 主开发了名为 dsh-routing-suite 的注入器插件并在 GitHub 上发布。该插件通过定位模型中能正确路由的参数区间,强制纠正模型的路径选择。实测表明,经过修复后的 DeepSeek v4flash 性能有显著提升,体感表现已接近 GLM-5.3 水平。虽然目前 v4pro 因正确路由区间极小,修复难度较大,暂未获得同等幅度的提升,但社区正在积极攻克这一难题。该事件不仅揭示了模型内部架构的复杂性,也展示了开源社区在挖掘模型极限性能方面的独特能力。
事件分析
从技术角度看,通过外部注入器修正内部路由,属于一种非常规的“模型外科手术”,这通常得益于模型的某种程度透明性或可解释性接口的残留。这也从侧面印证了开源生态的强大生命力:当官方模型出现瑕疵时,全球开发者能够通过逆向工程和协同开发迅速提出解决方案。这种“社区补丁”模式,未来可能成为开源大模型区别于闭源模型的核心竞争力之一,即不仅是使用模型,更是共同进化模型。
核心观点:社区通过修复 DeepSeek 路由机制实现性能“越狱”,揭示了开源模型在工程瑕疵上的可修复性,这正是开放生态对抗闭源黑盒的核心护城河。
原文链接:Linux.do