随着 AI 编程和远程协作场景的普及,尤其是“Vibe Coding”模式的兴起,开发者对于 AI Agent 识图及理解界面的能力提出了更高要求。然而,在实际工作流中,向 Agent 传递准确的视觉信息仍存在瓶颈。现有的 IDE 集成工具(如 Cursor 的 Design Mode)虽然强大,但在处理动态画面、多步骤操作或跨应用场景时,往往无法覆盖所有需求,导致开发者需要反复截屏、标注并进行 Debug,效率受限。针对这一痛点,SUB&SUB 工作室推出了开源项目 Markup Relay。该工具定位为 Agent 的“导盲犬”与接力助手,致力于解决标注内容与 Agent 识别之间的鸿沟。Markup Relay 允许用户在桌面端浏览器中通过拖拽操作,对屏幕内容进行标注。其核心价值在于能够将标注信息转化为 Agent 易于理解的描述,即便是面对动态变化的视频画面,也能通过提取关键帧来精准描述画面变动。这种机制极大地降低了多模态交互的门槛,使得 AI 能够更准确地理解复杂的视觉上下文。
事件分析
💡 核心观点:Markup Relay 的本质是为 AI Agent 引入“视觉翻译层”,它通过将复杂的图形交互标准化为提示词,补齐了 Vibe Coding 中多模态交互的关键短板。
原文链接:V2EX 分享发现





