跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
前沿哨所

四大国产模型实战对决 Luna Max:全员通关,Qwen 最快,Luna 却便宜 50-100 倍

3 分钟阅读阅读()
赞助推荐 团队协作里的 AI 办公工作台

科技论坛 Linux.do 用户发布了一项国产大模型编程能力的实战对比测试。测试选取 GLM、DeepSeek、Qwen、MiMo 四款国产模型,与 Luna Max 进行同题对决,统一使用 Claude Code CLI 作为执行框架,未采用各家专属编程工具以保证对比条件一致。结果显示,五款模型全部 100% 通过任务,但耗时和步骤数差异显著:Qwen 以 17 分钟位居最快,DeepSeek 用时 22 分钟,GLM 耗时 32 分钟,MiMo 用时 33 分钟,Luna Max 则超过 1 小时,耗时最长。测试者透露了若干细节:DeepSeek 使用 high 档运行,而其他模型均拉满配置,对 DeepSeek 略有不利;GLM 因多次缓存突然归零导致消费偏高,与 Claude Code CLI 的配合度不佳;MiMo 在 33 万 token 上下文时触发了一次压缩,其余模型均未压缩。成本方面,若计入中转站倍率,Luna Max 反而比其他模型便宜约 50 至 100 倍,呈现以超长思考时间换取极低价格的特征。需要注意的是,该测试每个模型仅运行一次,样本量有限,结果仅供参考,不具备严格基准测试的统计意义,但为开发者选型提供了真实场景下的第一手参考数据。

事件分析

此次社区测试的核心价值在于统一了执行框架,将模型原始能力与工具适配性区分开来,测试同时暴露出一个常被忽视的维度:模型与编程框架的兼容性。GLM 的缓存失效问题会直接放大实际调用成本,提示 API 缓存策略优化对厂商的重要性;上下文压缩行为差异则反映各家在长上下文管理上的技术路线不同。从产业角度看,国产模型在 Claude Code 这类主流 Agent 框架中的可用性持续提升,正在形成实际可用的竞争力。Luna Max 以超长思考换取极低价格的策略,也暗示推理成本市场仍存在分层空间。单次测试偶然性较大,后续值得关注的方向包括:社区是否出现多任务多轮次的系统性评测,以及厂商是否会针对主流编程框架进行专项适配优化。

核心观点:模型评测正从榜单跑分走向真实 Agent 实战,缓存稳定性与框架适配度正在成为比基准分数更关键的成本变量。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

原文链接:Linux.do

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 四大国产模型实战对决 Luna Max:全员通关,Qwen 最快,Luna 却便宜 50-100 倍
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型