WebMCP 是一项由 Google (Chrome) 和 Microsoft (Edge) 联合提出的拟议 Web 标准,旨在解决 AI Agent 操作网页效率低下且脆弱的痛点。当前的 AI 智能体多依赖 DOM 抓取和视觉模拟来操作网页,这种反向工程的方式极易因 UI 布局微调而失效。WebMCP 提倡“声明式”交互:允许网站直接将其功能(如预订、搜索)注册为结构化工具,使 AI Agent 能像调用 API 一样直接在用户的登录会话中执行 JavaScript 函数。该技术目前在 Chrome 149+ 中处于 Origin Trial 阶段,开发人员仅需通过简单的 API(如 `document.modelContext.registerTool`)即可在十分钟内完成集成。文章还展示了“Career Copilot”应用实例,演示了 13 个工具如何协同工作,并强调了将操作分为“只读”、“可逆”和“需人工确认”的重要性。这标志着 Web 正从为人类设计的可读界面,向为 Agent 设计的可操作接口演变。
事件分析
从技术架构看,WebMCP 代表了 Web 交互从“视觉模拟”向“语义接口”的根本性跨越。它解决了当前 LLM 应用落地中“最后一公里”的执行难题,即如何让 AI 安全、稳定地在复杂 Web 环境中完成任务。产业层面,若该标准成为 W3C 规范,将推动 Web 开发进入“双模”时代:开发者不仅构建供人类使用的 GUI,还需维护供 Agent 调用的工具层。其安全模型设计颇具前瞻性,通过同源隔离和可见性执行(Visible Tab),避免了无头浏览器的隐私风险,同时强制关键操作需人工确认,为自动化代理设置了必要的安全阀。这是构建“Agentic Web”(智能体网络)的关键基础设施。
核心观点:WebMCP 推动网页架构从“供人类阅读”向“供 Agent 操作”演进,为人机协作奠定了标准化的基础设施。
原文链接:Hacker News