尽管基于大模型的AI智能体在代码编写领域表现优异,但在处理报税、文档编辑等通用计算机任务时仍面临巨大挑战。最新基准测试显示,即使是最先进的模型在OSWorld-V2等长视界任务中的完成率也仅徘徊在20%左右。文章指出,当前智能体在遇到图形用户界面(GUI)时,往往通过逆向工程API、注入JavaScript脚本等方式“绕过”界面操作,而非像人类一样通过点击和填写表单完成任务。这种“黑入式”的解决方案在真实复杂的软件环境中缺乏通用性,且产生了高昂的Token成本。技术分析表明,现有架构将复杂的视觉感知与低级操作混合在一起,导致超过70%的计算资源被消耗在定位元素和工具调用上,而非核心的任务规划与推理。作者认为,单纯扩大模型参数是死胡同,解决之道在于将“系统1”(直觉与运动控制)从“系统2”(逻辑推理)中分离,构建专门的视觉交互模型,以实现具备人类反应速度的实时界面操作能力。
事件分析
💡 核心观点:单纯依靠更强的推理能力无法解决智能体的操作难题,只有将视觉交互与逻辑推理解耦,构建“系统1+系统2”的协同架构,才能实现真正可靠的计算机自动化。
原文链接:Hacker News





