跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
前沿哨所

实测Claude与GPT代码审计:Opus全面领先,国产模型仍存幻觉短板

1 分钟阅读阅读(136)
赞助推荐 团队协作里的 AI 办公工作台

本文记录了一次针对 Rust 项目的 AI 代码审计实测。参赛者包括 Claude Opus、GPT-5.3-Codex、GLM-5 和 Minimax-2.5。测试发现,Claude Opus 在 Bug 覆盖率和代码深度挖掘上表现最佳,GPT-5.3-Codex 则以极高的准确性和零误报取胜。相比之下,国产模型 GLM-5 和 Minimax 虽然速度快,但在基础事实核查(如列数统计)上出现严重“幻觉”,提供的修复代码甚至包含语法错误。作者指出,在“Vibe Coding”场景下,Opus 负责全面找茬,Codex 负责精准修正,而国产模型在严肃审计中尚不可靠。

原文链接:Linux.do

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 实测Claude与GPT代码审计:Opus全面领先,国产模型仍存幻觉短板
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型