模型变强以后,AI 工作流更需要边界
我花了五分钟浏览 Twitter。时间不长,只能算一次信息切片,却足以看到两种完全不同的情绪。一边在庆祝新模型更快、更强,另一边已经开始讨论旧指令、验收标准和代理越界。 我比较在意后一种声音。模型能力像发动机,AGENTS.md、Skill...
标签索引
这个标签下有 1744 篇文章。按时间回看相关判断与实践记录。
标签精选
我花了五分钟浏览 Twitter。时间不长,只能算一次信息切片,却足以看到两种完全不同的情绪。一边在庆祝新模型更快、更强,另一边已经开始讨论旧指令、验收标准和代理越界。 我比较在意后一种声音。模型能力像发动机,AGENTS.md、Skill...
Agent 入门课程如果只教模型调用和 Prompt,学生做出来的通常仍是 Chatbot。真正能行动的 Agent 还需要工具契约、状态、权限、执行循环和评测。下面五课用 DeepSeek Harness 作为观察样本,但课程目标是建立可...
把 DeepSeek Harness 用于数字分身,真正困难的不是把人格提示词塞进系统消息,而是决定哪些状态属于人、哪些状态只属于一次 Agent 执行。这个边界一旦画错,后续每次框架升级都会牵动身份、记忆和授权数据。本文给出一套可替换 R...
很多人第一次用 Cursor,会让 Agent 直接“把这个功能做完”。它往往真能改出一堆文件,但你很难判断哪一处是对的,哪一处只是看起来像对的。 我更建议把第一次任务当成一次小型交接:选一个能看见、能测试、能回退的改动。Cursor 负责...
> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files ...
AI 竞争已经打到了第三层。第一层拼基础模型——GPT、Claude、Gemini 谁更强;第二层拼 Agent——Codex、Claude Code、Trae 谁更好用。DeepSeek 上周扔出一件新东西,直接把战场拉到了第三层:Har...
过去一年里,”让 AI 写测试优先”几乎成了 AI 编程的政治正确。绝大多数被传播的 CLAUDE.md、AGENTS.md、.cursorrules 里,都能找到一句”先写失败的测试,再写实现̶...
本周大模型圈最重要的信号不是又多了几个新模型,而是后训练、Agent能力和开源可用性同时加速。智谱、DeepSeek、Google、OpenAI和Anthropic都在用不同方式回答同一个问题:模型怎样从会聊天变成能稳定干活。
本文整理自「灵姐说AI」对 WorkBuddy、Kimi Work、千问办公和 TRAE Work 的同题实测。真正值得看的不是谁的界面更像 Codex,而是工作 Agent 进入日常流程后,什么才算可验证、可追责、可直接使用的交付。原视频...
本文整理自 OpenAI Dominik Kundel 在 AI Engineer World’s Fair 的演讲。它真正值得看的地方,不是 Codex 又多了几个功能,而是 OpenAI 正在把 coding agent 的关键能力从“...