源自 Linux.do 社区的最新评测数据显示,DeepSeek-V4 Flash(7月31日版本)展现了惊人的性能密度。尽管仅拥有285B参数,该模型在主流前端开发领域的表现已能与参数量接近其三倍的 GLM-5.2 互有胜负。评测深入分析了模型的编程能力差异,发现 Flash 模型严重受益于成熟的前端训练语料和训练方法,但在 Rust、Swift 等非热门技术栈中,性能出现断崖式下跌,仅能理解任务意图却无法掌握细节。值得注意的是,评测对比了 Pro/Flash Preview 版本,指出正式版在规划能力上的显著提升。然而,DeepSeek Flash 倾向于在动手前进行深度思考,单次思考过程可达 50K Token,导致其在 Claude Code 等受默认输出长度限制的工具中表现受限;在 Codex 环境中,由于工具迭代频繁,完成任务所需步骤数增加了 30% 至 40%。评测最后透露,DeepSeek 即将推出的原生 Harness 将解决配置限制和工具熟悉度问题,有望释放模型全部潜力。
事件分析
💡 核心观点:仅靠参数堆砌已非万能,DeepSeek Flash的实测证明:模型的长思考推理能力必须与适配的工具链及高质量长尾语料深度耦合。
原文链接:Linux.do





