阿里巴巴进行了一项极具挑战性的AI软件工程实验,测试AI智能体在长达233天(约8个月)的时间里维护100个代码库的能力。实验结果令人咋舌:绝大多数AI模型在长期迭代中表现糟糕,75%的模型导致代码质量持续退化,最终将原本能运行的系统搞崩。唯独Claude Opus展现出强大的稳定性,保持了一半以上的零退化率。这项研究揭示了当前AI编程技术的致命短板:缺乏长期记忆和对项目全局上下文的理解能力,导致AI在长期维护场景下不仅难以如臂使指,反而可能成为技术负债。
阿里233天实验曝光:AI智能体长期维护代码“越修越乱”,仅Claude幸存
未经允许不得转载:80aj » 阿里233天实验曝光:AI智能体长期维护代码“越修越乱”,仅Claude幸存
相关推荐
我用 AI 做完一个产品后,留下了这套交付闭环
DeepSeek Harness vs LangGraph: 数字分身 Runtime 怎么选
Cursor 的第一处改动:从规则到验证
Karpathy 讲透 Software 3.0:当英文成为编程语言,AI 工程师真正该设计什么
杀死代码评审:AI 写代码、AI 审代码之后,人剩下的是对齐
我把 Codex 上的几十个 Skill 迁移到了 DeepSeek Harness,全程可用
AI Agent 做 TDD 有没有用: 实测排名与 3 倍 token 成本
Codex 背后的 Harness:OpenAI 把 Coding Agent 的控制层讲透了