针对近期 Cursor 官方宣称的“Composer 2 性能超越 Opus”引发热议,有开发者发布实测报告予以反驳。该用户在测试简单的 Python 环境调用任务时发现,Cursor 新模型不仅出现错误,甚至在用户提醒后直接遗忘了核心目标,逻辑连贯性极差。测试者指出,在仅 50k 上下文窗口下表现如此糟糕,令人担忧其生产环境可用性。相比之下,其对比的老牌模型(Opus 4.6)则一次回答正确。该反馈揭示了部分 AI 编程工具存在“营销强于实战”的现象,提醒业界需理性看待模型参数与宣传。
开发者实测质疑 Cursor Composer 2:简单任务频出错,性能反不及老牌模型
未经允许不得转载:80aj » 开发者实测质疑 Cursor Composer 2:简单任务频出错,性能反不及老牌模型
相关推荐
我用 AI 做完一个产品后,留下了这套交付闭环
DeepSeek Harness vs LangGraph: 数字分身 Runtime 怎么选
Cursor 的第一处改动:从规则到验证
Karpathy 讲透 Software 3.0:当英文成为编程语言,AI 工程师真正该设计什么
杀死代码评审:AI 写代码、AI 审代码之后,人剩下的是对齐
我把 Codex 上的几十个 Skill 迁移到了 DeepSeek Harness,全程可用
AI Agent 做 TDD 有没有用: 实测排名与 3 倍 token 成本
Codex 背后的 Harness:OpenAI 把 Coding Agent 的控制层讲透了