实测国产 AI 编程能力:虽进步明显,但与 Claude、GPT 仍存显著差距
该文记录了一位深度用户对国产大模型(GLM、MiniMax、Kimi 等)与国际顶尖模型在 Coding Plan 领域的对比评测。作者认为,尽管国产模型近期发展迅猛,但在实际工作流中仍存在约 20%-30% 的能力短板。这看似不大的差距,...
标签索引 / 第 2 页
这个标签下有 22 篇文章。按时间回看相关判断与实践记录。
标签精选
该文记录了一位深度用户对国产大模型(GLM、MiniMax、Kimi 等)与国际顶尖模型在 Coding Plan 领域的对比评测。作者认为,尽管国产模型近期发展迅猛,但在实际工作流中仍存在约 20%-30% 的能力短板。这看似不大的差距,...
随着 MiniMax 2.7 与 Superpowers 等工具的兴起,AI 编程的实战能力备受瞩目。然而,最新的开发者实测揭示了当前 AI 在前端领域的局限性。在测试中,AI 频繁出现 UI 样式错乱、元素堆叠等问题,且基于截图的 AI ...
Linux.do社区曝光了一份关于京东云CodingPlan的测试报告。该报告通过详尽的基准测试,深入分析了京东云在AI编程领域的最新技术进展,重点考察了其模型在代码生成、逻辑推理及工程辅助等方面的实际表现。作为国产科技巨头在垂直领域的积极...
本文分享了作者在短视频制作场景下,对 ComfyUI、Flora 和 Voooai 三款基于节点的 AI 平台进行的深度实战测评。文章详细对比了这些工具在构建复杂工作流、图像与视频生成稳定性以及实际生产效率方面的差异。对于致力于将 AI 技...
针对高校及研发场景的编程需求,近期有用户对比了三家主流 AI 编程订阅计划。测评结果显示,Agent 智能协作能力与模型版本(量化版与满血版)已成为区分方案优劣的核心指标。尽管市面上存在多种编程助手,但部分产品因 Agent 能力较弱或仅提...
针对 OpenClaw 平台 ACP 接入编程 CLI 的实测显示,尽管通过 acpx 插件可以配置 Qwen 等模型接管终端任务,但实际开发体验并不理想。用户反馈该模式在执行复杂任务时缺乏中间过程的可视化反馈,处于“黑盒”状态,且后台进程...
最近 AI 工具 openClaw 凭借“一句话操控电脑”的概念迅速走红,但实测揭示了其尴尬现状。首先,该工具存在严重的提示词注入风险,用户被迫将其部署在独立的沙盒环境中运行。其次,这种安全隔离导致它无法访问开发机核心数据,仅能执行通用操作...
近期市面上涌现大量 OpenAI Codex 账号,主要源于 OpenAI 为拉新降低了注册门槛,导致注册机批量生成泛滥。然而实测发现,这些普通账号在代码生成方面存在严重的“降智”问题,完全无法胜任专业开发工作。这实则是 OpenAI 的差...
本文针对当前技术圈火爆的“Claw”类AI Agent工具进行了深度汇总与实测对比。文章详细评测了功能最强但资源占用高的OpenClaw、适合源码学习的Python版Nanobot、极致轻量的Rust版ZeroClaw以及适合边缘设备的Pi...
2月12日,国产大模型集体爆发 离春节(2月17日)还有五天,国产AI圈先搞了场”AI春晚”。2月12日凌晨,智谱正式官宣开源 GLM-5;同日晚间,MiniMax 上线 M2.5。两款模型几乎同时亮相,直接把国产大...