四大国产模型实战对决 Luna Max:全员通关,Qwen 最快,Luna 却便宜 50-100 倍
科技论坛 Linux.do 用户发布了一项国产大模型编程能力的实战对比测试。测试选取 GLM、DeepSeek、Qwen、MiMo 四款国产模型,与 Luna Max 进行同题对决,统一使用 Claude Code CLI 作为执行框架,未采用各家专属编程工具以保证对比条件一致。结果显示,五款模型全部 100% 通过任务,但耗时和步骤...
核心观点模型评测正从榜单跑分走向真实 Agent 实战,缓存稳定性与框架适配度正在成为比基准分数更关键的成本变量。
阅读全文