实战测评:从MiniMax到Opus 4.6,国产大模型在Agent场景下的真实表现
一位开发者在OpenClaw框架下深度实测了多款主流大模型在Agent场景的表现。测试发现,MiniMax 2.5虽有人情味但执行力较弱,智谱GLM 5逻辑能力强但缺乏温度,而Kimi k2.5凭借均衡的能力成为目前国产模型中的最优解。相比...
标签索引 / 第 5 页
这个标签下有 59 篇文章。按时间回看相关判断与实践记录。
标签精选
一位开发者在OpenClaw框架下深度实测了多款主流大模型在Agent场景的表现。测试发现,MiniMax 2.5虽有人情味但执行力较弱,智谱GLM 5逻辑能力强但缺乏温度,而Kimi k2.5凭借均衡的能力成为目前国产模型中的最优解。相比...
本文记录了一次针对前端网页修复任务的AI模型横向测评,参与者包括Qwen3.5-Plus、Grok 4.20 Beta以及Copilot(疑似GPT-5)。实测结果令人深思:Qwen未能完整读取上下文,擅自重写导致UI不一致;Grok出现严...
社区实测数据显示,通义千问最新版 Qwen 3.5 Plus 在百万级上下文处理能力上表现优异。在一场涵盖30轮对话、累计约5万 token 的复杂学习场景测试中,模型成功实现了全流程细节的精准抓取,未出现任何记忆丢失或幻觉问题。这一表现表...
一位技术博主模拟了游戏《弥留之际的爱丽丝》中的天平游戏,让Qwen-3.5、GLM-4、Kimi、豆包及DS-3.2五款主流AI大模型进行厮杀。在激烈的博弈对局中,Qwen-3.5表现最为惊艳,在决胜局通过精确计算各种可能性,成功预判并利用...
近期,一项针对国内主流大模型的“幸运转盘”代码生成测试在技术社区引发热议。该测试看似简单,实则对模型的逻辑严密性、多模态渲染及代码执行能力提出了极高要求。测试结果显示,DeepSeek 成为唯一成功完成任务的模型,完美解决了转盘指针与开奖结...
社区用户实测发现,DeepSeek App新模型在长上下文处理方面表现卓越。测试者利用repomix将一个200KB的代码库上传至DeepSeek,尽管官方宣称支持100万Token(1M)上下文,但实测显示模型响应速度极快(高TPS),在...
本文记录了一次针对 Rust 项目的 AI 代码审计实测。参赛者包括 Claude Opus、GPT-5.3-Codex、GLM-5 和 Minimax-2.5。测试发现,Claude Opus 在 Bug 覆盖率和代码深度挖掘上表现最佳,...
根据科技社区用户的最新讨论,DeepSeek 的新模型在不启用深度思考功能时依然表现出色。实测显示,该模型在长上下文处理能力上十分扎实,能够有效维持对话记忆,不再轻易遗忘之前的信息。更重要的是,用户普遍反映模型之前那种动不动就产生“科幻”内...
随着国产大模型的崛起,学术界在“沉浸式翻译”工具中的模型选择成为热点。近日,Linux.do 社区有用户针对医学专业文本,对 DeepSeek、千问及 GPT 三款轻量级模型进行了对比实测。结果显示,虽然国产模型表现不俗,但 GPT 在专业...
根据博主测评,智谱GLM-5是一款拥有744B参数的混合专家模型,定位为“系统架构师”。该模型在Agent规划、长上下文处理及复杂架构理解方面表现卓越,具备自我修复代码错误的能力,并在KingBench Agent排行榜上超越Opus 4....