SWE-CI基准发布:填补SWE-bench空白,评估AI Agent在CI环境下的真实代码维护能力
尽管大型语言模型(LLM)驱动的Agent在SWE-bench等基准测试中展现了强大的静态Bug修复能力,但成熟软件的实际开发往往依赖于复杂的需求变更和长期的功能迭代,这是传统的静态、单次评估模式所无法覆盖的。为了解决这一脱节问题,本文提出...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
尽管大型语言模型(LLM)驱动的Agent在SWE-bench等基准测试中展现了强大的静态Bug修复能力,但成熟软件的实际开发往往依赖于复杂的需求变更和长期的功能迭代,这是传统的静态、单次评估模式所无法覆盖的。为了解决这一脱节问题,本文提出...
传统的SWE-bench仅关注静态Bug修复,而新提出的SWE-CI基准更进一步,旨在评估LLM智能体在持续集成(CI)环境下长期维护代码库的能力。该测试跨越数月,模拟真实的软件开发全流程。实验结果显示,Claude 4.6在该基准中表现最...