警惕!研究揭示 LLM “暗腐”现象:在处理长任务时,AI 代理平均会篡改 25% 的文档内容
随着“氛围式编程”等 AI 代理模式的兴起,用户越来越倾向于将任务完全委派给大模型。然而,最新研究通过 DELEGATE-52 基准测试(涵盖 52 个专业领域)对 19 种主流 LLM 进行了评估,结果令人担忧:即使是目前的顶尖模型,在执...
标签索引
这个标签下有 4 篇文章。按时间回看相关判断与实践记录。
标签精选
随着“氛围式编程”等 AI 代理模式的兴起,用户越来越倾向于将任务完全委派给大模型。然而,最新研究通过 DELEGATE-52 基准测试(涵盖 52 个专业领域)对 19 种主流 LLM 进行了评估,结果令人担忧:即使是目前的顶尖模型,在执...
尽管AI编码工具厂商普遍推崇使用AGENTS.md等上下文文件来辅助理解代码库,但苏黎世联邦理工学院的最新研究对这一行业惯例提出了有力质疑。研究团队构建了AGENTbench数据集,针对Claude 3.5、GPT-5等主流模型进行了严格测...
一篇针对仓库级上下文文件(如 CLAUDE.md、AGENT.md)的最新研究引发了广泛关注,其结论令人意外。实验数据显示,这些旨在辅助 AI 理解项目的文件,往往弊大于利:自动生成的文件使 Agent 任务成功率平均下降约 3%,即便是人...
《哈佛商业评论》发表的一项最新研究揭示了AI在职场中的反直觉影响。研究指出,尽管AI工具理论上应提升效率,但实际应用中并未如预期般减少员工工作量。相反,由于AI加快了任务处理速度,企业往往会提高对产出和效率的预期,导致员工需要处理更多任务或...