
最近,科技公司 CEO 又开始说 AGI 已经到来,或者只差临门一脚。麻烦在于,大家嘴里的 AGI 并非同一个东西。有人盯着模型参数,有人看它能完成多少任务,还有人把工具、记忆和执行环境也算进去。
Caleb Writes Code 的视频《AGI, are we there yet..》给了一个很实用的拆法:暂时放下“机器有没有心智”这类哲学争论,沿着机制和能力两条轴来判断。这个框架仍有争议,却能解释一个越来越明显的现象:今天表现出智能的对象,往往已经是一整套系统。
原视频:https://www.youtube.com/watch?v=noPuRPDiY6k
先把机制和能力分开
上世纪八十年代,人们常用“弱 AI”和“强 AI”来区分机器智能。弱 AI 擅长一个狭窄领域,强 AI 则更接近拥有心智。今天的公共讨论已经悄悄换了问题。大多数人关心模型能干什么,很少追问它是否拥有哲学意义上的心灵。
视频因此换成两条轴。机制轴问智能怎样获得、怎样更新;能力轴问系统能够展示哪些任务水平。两条轴经常混在一起,所以同一套模型能同时得到“AGI 已经来了”和“它连家务都做不好”的判断。
“下一词预测”属于机制批评。修水管、照看孩子、自动驾驶属于能力批评。前者可能低估规模训练中涌现出的行为,后者又容易把一张随意列出的任务清单当成通用智能的边界。两种说法都抓到一部分,也都不足以单独结案。
视频引用 François Chollet 的标准:通用智能更看重系统能否在陌生情境中获得新技能。按这个口径,当前模型仍有明显缺口。模型在数据中心训练数月,发布 checkpoint 后,参数在推理阶段大体固定。它能调用已有知识解决新题,不等于它在现场真正学会了一项新本领。
ARC-AGI 测到的可能是一套组合能力
ARC-AGI 想测的是新任务中的抽象和适应。视频举了一个很刺眼的案例:Astra 在 ARC-AGI 3 上可以达到 99.9%,换一套 harness 后,表现会明显不同。99.9% 是视频给出的口径。比高分更值得看的,是成绩为何依赖模型外面的东西。
Harness 可以理解成模型的工作台。它替模型管理上下文和长期记忆,接上终端、数据库、MCP 与技能文件,还负责循环执行和错误恢复。模型没有在推理时改写参数,整个系统却能通过保存状态、重试和调用工具,表现出某种“边做边学”。
Codex、Claude Code 这类产品已经很接近这种组合。视频转述 Claude Code 创建者的估计:工程层能把模型能力向外延伸约 10%–20%。这个比例同样应按讲者陈述看待,但方向与实际体验一致。相同模型放进不同运行环境,完成长任务的差距可以很大。
这也带来一个评测难题。如果测试只公布模型名和总分,却不公开上下文策略、工具、重试次数、记忆与执行环境,我们很难知道分数究竟属于模型,还是属于完整系统。汽车跑得快,既有发动机的功劳,也有变速箱、轮胎和驾驶控制的功劳。只报发动机型号,信息不够。
Harness 也不能把缺失的能力凭空补出来
把 AGI 的观察对象扩大到系统,并不代表外层工程可以包治百病。知识库里《Dex Horthy 说 harness 不能救所有问题》专门提醒过这一点:模型如果缺少长期抽象、隐性约束或真实环境理解,再复杂的 loop 也只能限制它犯错,没法替它长出那部分理解。
视频自己也划出了边界。今天的 harness 仍有大量手写规则,像给模型装上临时脚手架。Richard Sutton 的“苦涩的教训”认为,长期占上风的通常是依靠计算和学习的通用方法。顺着这个判断看,未来一部分手写结构可能会由模型自己学会,脚手架也会变薄。
在过渡期里,模型和 harness 是共同瓶颈。模型负责推理与生成,外层系统负责目标、工具、记忆、验证和恢复。任何一边太弱,系统都会掉链子。把所有成功都归给模型,会制造能力幻觉;把所有失败都怪到 harness,也会掩盖训练层的问题。
通用智能不要求每门考试都拿第一
视频的另一条轴是能力。Tim Urban 很早就用 ANI、AGI、ASI 描述智能层级。ANI 是专用智能,AGI 强调跨领域的迁移和适应,ASI 指向远超人类的智能。
这里有个常见误区:只要找出一件模型做不到的事,就宣布 AGI 尚未出现。Yann LeCun 举过修浴室、照看孩子和完全自动驾驶这类例子。问题是,专用系统本来就可能在某个窄任务上胜过通用系统。人类拥有通用智能,也很少有人能在围棋、天气预报和工业焊接上同时超过专用机器。
因此,第一套获得 AGI 名称的系统,完全可能在一些任务上输给 ANI。更合适的能力指标,是它能否迁移知识、处理陌生规则、适应变化,并在反馈后改进下一步。通用性的重点是换了场景还能继续工作,无需把所有排行榜冠军一次收齐。
这也解释了 AGI 为何很难出现一个全球统一的“越线时刻”。各家公司选择的任务、环境和门槛不同,自然会在不同时间宣布达标。CEO 说“我们到了”,更像采用了一套内部定义,很难自动变成科学共同体的结论。
一个定义模糊的词,已经在指挥真金白银
视频收尾时把讨论从科学拉回经济。Dario Amodei 曾把 AGI 叫作营销术语,他自己又用“数据中心里的天才之国”描述未来能力。行业一边嫌弃 AGI 定义不严谨,一边持续用更响亮的词争夺注意力。
这场争论无法简单忽略,因为 AGI 已经影响融资、公司估值、数据中心建设和人才招聘。多位 CEO 把时间表放在未来 5 到 10 年。这个区间的含义很具体:足够近,可以支持今天的大额投资;又足够远,短期内很难证伪。
历史上的两次 AI 寒冬都伴随过高预期和低兑现。生成式 AI 已经创造了真实价值,今天的技术基础远强于早期阶段,但经济叙事仍可能跑在可验证能力前面。若行业不断移动门槛,每隔几年都说“再等五年”,公众迟早会对同一套承诺失去耐心。
因此,每次听到“某模型已经达到 AGI”,都可以追问三件事:它采用什么机制标准,能力是否能迁移到陌生任务,成绩用了怎样的 harness。三项说清楚,AGI 才从口号变成可讨论的工程命题。
我的补充:把系统边界写进评测报告
本地知识库过去几个月一直在追踪 harness engineering。已有材料把 Agent 写成 Model + Harness,并把真实世界评估扩展到任务轨迹、工具调用、成本和失败恢复。这个视频补上了更高一层的连接:AGI 评测也需要同样的系统边界说明。
以后看到一个惊人的 benchmark,评测报告至少应该公开模型版本、可用工具、上下文与记忆策略、重试预算,以及环境有没有替模型保存经验。缺少这些信息,两个同名模型的分数也可能没有可比性。
AGI 也许会先以系统的形态出现:模型本身还不会在线改写参数,外层工作台已经能让它积累状态、调用工具并修复错误。这个阶段足够重要,值得严肃对待;它也足够混杂,不适合只靠一个标签宣布胜利。
如果 AGI 的未来总被描述成“五年后”,眼下最实用的动作是先把测量尺画清楚。







