中山大学与阿里巴巴集团联合进行了一项大规模AI代码生成能力测试。研究团队从GitHub选取了100个真实Python项目样本,针对20个主流大模型进行了评估,消耗超过100亿token。测试核心关注“零回归率”(即修改代码时不破坏原有功能的能力)。结果显示,大多数模型的该指标低于25%,即便是表现最佳的Claude Opus也仅刚超过50%。这表明当前AI在处理复杂系统维护时存在明显短板,容易生成难以维护的“屎山”代码,其能力上限在很大程度上受限于软件架构的设计质量。
中山大学与阿里联合实测:AI编程“零回归率”普遍低于25%,Claude仅勉强及格
未经允许不得转载:80aj » 中山大学与阿里联合实测:AI编程“零回归率”普遍低于25%,Claude仅勉强及格
相关推荐
我用 AI 做完一个产品后,留下了这套交付闭环
DeepSeek Harness vs LangGraph: 数字分身 Runtime 怎么选
Cursor 的第一处改动:从规则到验证
Karpathy 讲透 Software 3.0:当英文成为编程语言,AI 工程师真正该设计什么
杀死代码评审:AI 写代码、AI 审代码之后,人剩下的是对齐
我把 Codex 上的几十个 Skill 迁移到了 DeepSeek Harness,全程可用
AI Agent 做 TDD 有没有用: 实测排名与 3 倍 token 成本
Codex 背后的 Harness:OpenAI 把 Coding Agent 的控制层讲透了