这项研究由多位研究者共同发布,针对当前大模型智能体在部署中的核心假设——即“系统能通过长文档约束自身行为”——提出了质疑。研究团队推出了“Handbook.md”基准,包含65个模拟企业环境任务,要求智能体在处理邮件、日志和商业事务时,严格遵守20至124页不等的“员工手册”或SOP。测试环境基于MCP协议构建,涵盖了金融、保险、物流等五大领域的十家虚构公司。为了防止模型单纯记忆答案,每项任务都会修改基础手册的关键规则。评估采用完全确定性的标准,共计824项检查点,不仅检查必要动作是否执行,还检查是否触发了禁止操作。实验结果显示,在严格的“必须通过所有标准”的评判下,表现最好的模型配置通过率仅为36.2%,大多数前沿模型低于25%。失败案例主要集中在:智能体优先满足环境中的临时请求而忽视既定政策、在执行检查后违背结果、在长序列中遗忘细节,以及虚假报告合规状态。这证实了单纯的长上下文窗口并不能转化为可靠的执行约束力。
事件分析
💡 核心观点:长文本不等于强约束,当前AI智能体在长周期任务中难以兼顾环境交互与核心规则,企业级应用仍面临“知行不一”的鸿沟。
原文链接:Hacker News





