本文发布了一项针对 DeepSeek v4 Flash 0731(DSv4F)及多款国产平价大模型的编程能力基准测试报告。测试基于 Workbuddy-Bench-Code v1.0 数据集,包含 80 个编码任务,使用 CodeBuddy Cli 作为测试框架,并隔离了 Web 搜索等外部工具,以纯粹评估模型的代码生成与执行能力。在针对 DSv4F 的多渠道对比中,官方 API、OpenCode Go、Ollama Cloud Pro、Workbuddy 原生渠道、火山方舟及千问平台等六大渠道参与了测试。结果显示,各渠道提供的 DSv4F 模型在编程能力上几乎没有区别,评分表现一致,主要差异在于响应速度与计费策略。这意味着用户在购买 DSv4F 服务时,无需担心模型性能被“阉割”,可优先根据网络速度和预算选择供应商。在国产实惠档模型的对比中,DeepSeek v4 Flash 凭借性能优势成为该价位段的首选。MiniMax M3 在提供大额度的同时保持了可用性,而 Mimo 2.5 Pro 虽然价格便宜,但存在严重的任务中断问题,稳定性较差。LongCat 2.0 虽然性能平庸,但在低价套餐下的耐久度表现优异,且成本极低。测试还揭示了不同厂商的计费陷阱:Mimo 消耗了 34 元套餐的 80%,而 LongCat 仅消耗了 9.9 元套餐中的一部分。该报告为开发者在选购低成本 LLM 进行编程辅助时提供了详实的参考数据。
事件分析
💡 核心观点:DeepSeek 凭借极致性价比与多渠道一致性重塑市场格局,国产平价竞品在稳定性与长上下文处理上仍存短板。
原文链接:Linux.do





