云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

实测:DeepSeek 与 GPT 在浏览器控制任务中的表现差异

云聚 AI Token Plan 满 199 减 35 元

近日,有开发者在社区反馈了在使用 Codex(一种 AI 编程或开发工具环境)时的一个有趣现象。该开发者在测试过程中,首先将底层模型切换为 DeepSeek,并尝试通过 AI 指令让其自动打开 macOS 平台的 Safari 浏览器以查看网页。然而,DeepSeek 模型在执行该任务时未能成功,系统提示要求调用无障碍模式,导致操作停滞。随后,当开发者将模型切换回 OpenAI 的 GPT 系列模型时,同样的指令被迅速且准确地执行,Safari 浏览器成功被唤起。这一对比引发了关于大模型 Agent 能力的讨论,显示出虽然 DeepSeek 等新兴模型在推理层面表现强劲,但在涉及具体的操作系统底层交互(如 macOS 无障碍 API)和函数调用稳定性上,OpenAI 似乎仍保留了一定的技术护城河和优化优势。

事件分析

此次事件揭示了当前 AI Agent 领域“推理能力”与“控制能力”的不对称性。虽然开源或新兴模型在逻辑推理上已能比肩 GPT-4,但在将推理转化为对真实操作系统(如 macOS 无障碍 API)的精准操控上,依然存在工程化差距。DeepSeek 等模型可能在代码生成和数学推理上表现优异,但针对特定终端环境的函数调用(Function Calling)微调、系统提示词工程以及错误处理机制可能尚未完善。OpenAI 通过大量的用户反馈闭环(RLHF),在处理系统级交互的边界情况时显得更加稳健。这意味着,未来的模型竞争将不仅局限于“大脑”的聪明程度,更将延伸至“手脚”的灵活性,即模型与操作系统、浏览器及各类软件生态的深度融合与适配能力。

💡 核心观点:大模型竞争维度已从单纯的“智商”比拼转向“执行”较量,OpenAI在系统交互与Agent落地上的工程壁垒短期内难以被复制。

阿里云 OPC 一人公司创业装备库

原文链接:Linux.do

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 实测:DeepSeek 与 GPT 在浏览器控制任务中的表现差异
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型