AI 竞争已经打到了第三层。第一层拼基础模型——GPT、Claude、Gemini 谁更强;第二层拼 Agent——Codex、Claude Code、Trae 谁更好用。DeepSeek 上周扔出一件新东西,直接把战场拉到了第三层:Harness。
Agent 的公式很简单:Agent = 模型 + Harness。模型是灵魂,Harness 是让它跑起来的骨架,负责理解环境、调用工具、在真实场景里持续执行。之前大家都在卷模型和 Agent 产品本身,很少有人专门把 Harness 拆出来做。
DeepSeek Harness 一发布,两天拿了 11 万 Star。开源、Web 端、一切皆插件。
原视频:https://www.youtube.com/watch?v=2NP1NNMrIf4
一切皆插件
这是 DeepSeek Harness 最核心的设计理念。
模型、工具、技能(Skill)、会话、沙箱、存储、循环调度、UI——全部由插件提供。你用 Codex 的时候,插件是在主 Agent 外面加的能力扩展;但在 DeepSeek Harness 里,连 Agent 本身都是插件拼出来的。
模型可以换,沙箱可以换,工具链可以换,像拼乐高一样排列组合。它还支持社区插件。去 GitHub 找到插件仓库地址,发给 Harness,它自己就能装。
更实用的一条:你在 Codex 上沉淀的 Skill 可以直接迁移过来。视频里演示了把 Codex 上的几十个 Skill 无缝嵌入 DeepSeek Harness,用斜杠命令直接调用。迁移方式也简单,让 Codex 或 GPT 帮你做复刻就行。
四种运行模式
DeepSeek Harness 提供四种模式,选择逻辑其实不复杂:
| 模式 | 用途 | 说明 |
|---|---|---|
| 标准 | 日常大部分任务 | 全套基础能力,默认选项 |
| PTC | 专项/重复型编码任务 | 标准模式 + 让模型用 TypeScript 程序组合多步操作,省 Token |
| 极简 | 需要快速输出 | 精简流程,速度最快 |
| 创造 | 构建新 Agent / 不确定任务 | 标准模式基础上帮你设计子 Agent、拆分系统 |
标准模式覆盖大多数场景;跑代码密集型任务时 PTC 模式更省 Token;需要设计一整套 Agent 体系(比如视频里举的”内容工厂”——信息收集子 Agent、素材构建子 Agent、编辑剪辑子 Agent)就开创造模式。
Web 端带来的自由度
DeepSeek Harness 是 Web 端运行的,Codex 和 Claude Code 是 App。这个区别听起来不大,实际影响很大。
Web 是通用协议。Codex 要改权限、装插件、做远程访问,每一步都涉及 App 层的限制。DeepSeek Harness 因为跑在浏览器里,自由度高得多——远程访问就是一个 ngrok 的事。
视频里演示了用 ngrok 把本地 Harness 端口暴露成公网链接,手机或另一台电脑直接打开就能操作,主电脑还能实时看到远程的操作轨迹。
执行轨迹可视化
这条值得单独说。
DeepSeek Harness 的执行过程用色块标注:紫色是 Assistant 调用,黄色是工具调用,淡黄色是子工具。每一步花了多少 Token、调用了什么、思考了什么,全部可见、可回溯。
用 Codex 或 Claude Code 的时候,执行过程的中间步骤只能看到一部分,不能完整回溯。有了轨迹可视化,调试、审计、修正执行过程就方便得多。
实测:DeepSeek Harness vs Codex
视频用两个任务做了对比测试。
任务一:3D 城市编辑器(OpenAI 官方案例,原本用来测试 Codex + GPT-5.5)
两边同时跑,DeepSeek Harness 反馈速度明显更快,生成过程全程可见。结果方面,两边都搭出了完整的 3D 城市框架:不同视角切换、城市风格选择、街区密度和大小调节、街道类型(方格/雷达/随机)都有。Codex 的成品在一些细节上略好(部分按钮有实际功能),但 DeepSeek Harness 用的模型是 DeepSeek V4 Pro,成本远低于 Codex 用的 GPT-5.6。
任务二:黑洞光线追踪器(Kimi 官方案例,Kimi 用集群模型跑的,Token 消耗很大)
这轮 DeepSeek Harness 耗时更长。成品形态基本完成——精度、纬度、高度等参数可调,有视角切换和自动播放。Codex 的配色和画面细腻度更好,但 DeepSeek Harness 在用了更低成本模型的前提下,大框架搭出来了,优化提示词后可以继续打磨。
两个任务的结论一致:在模型成本远低于对手的情况下,DeepSeek Harness 的产出完成度已经接近 Codex。 换成更强的模型,差距会进一步缩小。
第三层竞争:Harness 即基础设施
视频最后提出了一个值得思考的框架:AI 竞争分三层。
| 层级 | 竞争内容 | 代表 |
|---|---|---|
| 第一层 | 基础模型 | GPT、Claude、Gemini、DeepSeek |
| 第二层 | Agent 产品 | Codex、Claude Code、Trae、WorkBuddy |
| 第三层 | Harness / 基础设施 | DeepSeek Harness |
基础模型的能力差距正在缩小。当模型越来越像”商品”,竞争的重心就会上移到”谁来组织和管理 Agent”。DeepSeek Harness 的定位就是 Agent 基础设施——一套制作、管理、部署各类 Agent 的控制系统。
类比安卓:安卓不制造最好的芯片,但它占了手机应用生态。中国公司在基础模型和开发者生态上暂时落后于美国,但 Harness 层可能是一个弯道超车的机会——它影响的是谁来控制 Agent 平台、谁来掌握应用生态、谁来组织企业里的 Agent。
一天上手后的判断
DeepSeek Harness 还是开发者预览版,后续可能有不兼容更新。但它展示的设计思路——一切皆插件、Web 端的灵活性、执行轨迹可视化、低成本接入多种模型——已经跑通了一条和 Codex / Claude Code 不同的路。
如果你已经在用 Codex 沉淀了一批 Skill,可以先把它们迁移到 DeepSeek Harness 里试试——开源环境的好处就是可以随意魔改。想体验远程操作和执行轨迹回溯,Web 端加上 ngrok 几分钟就能跑起来。
