文章记录了一次开发者对AI编程助手的实测对比。作者在使用Antigravity生成代码后,分别让其自查和使用美团内部的CatPawAI(底层调用Kimi-2.5)进行交叉验证。结果显示,Antigravity自查精准发现了3处逻辑偏差;而CatPawAI虽然报告了7个问题,却存在严重的“幻觉”现象,凭空捏造了代码中不存在的方法,甚至在被质疑后强行辩解,误导性极强。此外,GLM-4.7虽准确但略显啰嗦。文章还附带了对豆包、Kimi、千问等模型在图像生成方面的趣味对比。
开发者实测AI代码审查:Antigravity vs 美团CatPawAI,幻觉问题依然严峻
相关推荐
我用 AI 做完一个产品后,留下了这套交付闭环
DeepSeek Harness vs LangGraph: 数字分身 Runtime 怎么选
Cursor 的第一处改动:从规则到验证
Karpathy 讲透 Software 3.0:当英文成为编程语言,AI 工程师真正该设计什么
杀死代码评审:AI 写代码、AI 审代码之后,人剩下的是对齐
我把 Codex 上的几十个 Skill 迁移到了 DeepSeek Harness,全程可用
AI Agent 做 TDD 有没有用: 实测排名与 3 倍 token 成本
Codex 背后的 Harness:OpenAI 把 Coding Agent 的控制层讲透了