模型变强以后,AI 工作流更需要边界
我花了五分钟浏览 Twitter。时间不长,只能算一次信息切片,却足以看到两种完全不同的情绪。一边在庆祝新模型更快、更强,另一边已经开始讨论旧指令、验收标准和代理越界。 我比较在意后一种声音。模型能力像发动机,AGENTS.md、Skill...
AI 情报局
大模型、AI Agent、模型评测与产业动态。
本栏重点
我花了五分钟浏览 Twitter。时间不长,只能算一次信息切片,却足以看到两种完全不同的情绪。一边在庆祝新模型更快、更强,另一边已经开始讨论旧指令、验收标准和代理越界。 我比较在意后一种声音。模型能力像发动机,AGENTS.md、Skill...
观察区间:2026.08.29-09.04。系列内部编号为第43期;该日期跨 ISO 第35与第36周,所以标题直接使用日期口径。 这一周的信息很多,真正值得记住的只有三条线:旗舰模型开始围绕长任务和电脑操作换代;网络安全能力从评测项目变成...
大模型回答问题之前,内部可能已经完成了一轮判断,只是没有把过程说出来。J-Space 等研究让人看见局部内部表示,也提醒我们:能解释一点,离完整理解和可靠控制还很远。
> 大模型周刊|2026.08.16–08.28 过去两周的主线很清楚:安全事故被写进技术报告,Agent 开始进入浏览器、硬件和课堂;国产开源模型用“匿名测、正式认、权重放”拿下流量。闭源厂商忙着补可控性,开源阵营在补生态与成本。榜单仍然...
DeepSeek Harness 的竞争对象不是某个聊天界面,而是承担状态、工具、执行与恢复的 Agent Runtime。选型时如果只比功能清单,很容易把框架的演示能力当成生产能力。本文把 DSH 与 LangGraph、Microsof...
Agent 入门课程如果只教模型调用和 Prompt,学生做出来的通常仍是 Chatbot。真正能行动的 Agent 还需要工具契约、状态、权限、执行循环和评测。下面五课用 DeepSeek Harness 作为观察样本,但课程目标是建立可...
学习一个 Agent Runtime 最容易走偏的方式,是平均阅读所有文档,然后做一堆彼此无关的 demo。更有效的路线是围绕一个可验收产品逐层补能力:先让分身只读地认识你,再加入记忆、动作、权限和评测。下面的 30/90 天计划以这一顺序...
把 DeepSeek Harness 用于数字分身,真正困难的不是把人格提示词塞进系统消息,而是决定哪些状态属于人、哪些状态只属于一次 Agent 执行。这个边界一旦画错,后续每次框架升级都会牵动身份、记忆和授权数据。本文给出一套可替换 R...
要理解 DeepSeek Harness,最短路径不是先学界面和命令,而是看它怎样把模型、工具、会话、循环、沙箱和 UI 组合成一个运行时。Cordis 是这套组合模型的底层,它决定了插件怎样挂载、依赖怎样替换,以及卸载后副作用怎样被撤销。...
DeepSeek Harness 首周最值得看的不是星标增速,而是发布节奏暴露出的工程现实:插件能力扩张很快,存储、包管理和安全边界也仍在变化。本文把截至 2026 年 8 月 24 日的公开信号放在同一条时间线上,给出原型、试点与生产三种...
> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files ...
本文整理自 AI Engineer 大会上 Aviator 联合创始人 Ankit Jain 的演讲《How to Kill the Code Review》。他几个月前写过一套「杀死代码评审」的五层信任模型,这次上台主要做自我修正:评审从...
AI 个人订阅只需要看两组对标:**ChatGPT Plus 对 Claude Pro,ChatGPT Pro 对 Claude Max 5× / Max 20×**。放在一张总表里,价格和额度关系会清楚很多。 月金额按一年 52 周折算:...
AI 竞争已经打到了第三层。第一层拼基础模型——GPT、Claude、Gemini 谁更强;第二层拼 Agent——Codex、Claude Code、Trae 谁更好用。DeepSeek 上周扔出一件新东西,直接把战场拉到了第三层:Har...
过去一年里,”让 AI 写测试优先”几乎成了 AI 编程的政治正确。绝大多数被传播的 CLAUDE.md、AGENTS.md、.cursorrules 里,都能找到一句”先写失败的测试,再写实现̶...
本周大模型圈最重要的信号不是又多了几个新模型,而是后训练、Agent能力和开源可用性同时加速。智谱、DeepSeek、Google、OpenAI和Anthropic都在用不同方式回答同一个问题:模型怎样从会聊天变成能稳定干活。
本文整理自「灵姐说AI」对 WorkBuddy、Kimi Work、千问办公和 TRAE Work 的同题实测。真正值得看的不是谁的界面更像 Codex,而是工作 Agent 进入日常流程后,什么才算可验证、可追责、可直接使用的交付。原视频...
如果最近一轮 Claude 封号潮把你赶出了个人订阅,这个标题可能很有画面感:一家南洋公司开始“招聘 Claude 难民”,月薪没有,工位费倒是每月 275 元。 这里的“招聘”当然不是劳动合同,而是加入一家新加坡公司的 Claude Te...
2026 年 8 月第一周没有新的旗舰模型炸场,但产品下沉、企业合规、开源视频、Agent 基础设施和融资动作都在加速。真正的主线越来越清楚:大模型竞争正在从参数规模,转向稳定、便宜、可控地交付工作流。 上半月的余温还在。OpenAI 继续...
Jason Liu 在 AI Engineer 的这场 Codex 工作坊,表面是在讲 appshots、skills、plugins、memory、automation 和 computer use,实际讲的是一个更大的转向:Agent ...