代码大模型SWE-rebench最新榜:Claude夺冠,DeepSeek性价比突围
SWE-rebench公布了基于2025年12月GitHub真实任务的最新评测榜单。Anthropic的Claude Opus 4.5以63.3%的解决率位居榜首,OpenAI GPT-5.2与谷歌Gemini 3 Flash Previe...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
SWE-rebench公布了基于2025年12月GitHub真实任务的最新评测榜单。Anthropic的Claude Opus 4.5以63.3%的解决率位居榜首,OpenAI GPT-5.2与谷歌Gemini 3 Flash Previe...