比流行更重要
记录真实用法、成本、限制和可复用经验。
2026-08-2480aj · 八零智记
记录 AI 工程实践、工具链和产品思考,做难而正确的事。
记录真实用法、成本、限制和可复用经验。
2026-08-24DeepSeek Harness 的竞争对象不是某个聊天界面,而是承担状态、工具、执...
4 小时前从 ChatGPT 桌面端使用到 Codex、M…
306 篇内容DeepSeek Harness 的竞争对象不是某个聊天界面,而是承担状态、工具、执行与恢复的 Agent Runtime。选型时如果只比功能清单,很容易把框架的演...
Agent 入门课程如果只教模型调用和 Prompt,学生做出来的通常仍是 Chatbot。真正能行动的 Agent 还需要工具契约、状态、权限、执行循环和评测。下...
学习一个 Agent Runtime 最容易走偏的方式,是平均阅读所有文档,然后做一堆彼此无关的 demo。更有效的路线是围绕一个可验收产品逐层补能力:先让分身只读...
把 DeepSeek Harness 用于数字分身,真正困难的不是把人格提示词塞进系统消息,而是决定哪些状态属于人、哪些状态只属于一次 Agent 执行。这个边界一...
从 ChatGPT 桌面端使用到 Codex、MCP、Skills、工作流和常见故障,按任务找到可直接照着做的实战内容。
适合 Codex CLI、Codex App 与 IDE 用户Claude / GPT / Gemini / Grok / DeepSeek / Qwen / Llama / MiniMax 等主流大模型在能力、价格、速度、使用场景上的横评与选型建议(按月更新)。
LangChain / LangGraph / LangSmith / Langfuse / n8n / Dify / Coze / FastGPT / AutoGen / CrewAI 等主流 Agent 框架的横向对比、真实业务案例与 cookbook。
AI Engineer World's Fair 2026 主舞台内容专题,按 Software Factories 与 Autoresearch 两条主线归拢 Day 1、Day 2 的长文总览和单场分享。重点关注 agent 工作流、软件工厂、验证、记忆、研究循环、评估与责任边界。
claude-opus-4-8gpt-5.6-sol要理解 DeepSeek Harness,最短路径不是先学界面和命令,而是看它怎样把模型、工具、会话、循环、沙箱和 UI 组合成一个运行时。Cordis 是这套组合模型的底层,它决定了插件怎样挂载、依赖怎样替换,以及卸载后副作用怎样被撤销。...
DeepSeek Harness 首周最值得看的不是星标增速,而是发布节奏暴露出的工程现实:插件能力扩张很快,存储、包管理和安全边界也仍在变化。本文把截至 2026 年 8 月 24 日的公开信号放在同一条时间线上,给出原型、试点与生产三种...
ChatGPT Desktop 里的 Work 面向跨步骤交付,Codex 面向代码库执行。选模式时应先看任务的核心对象和验收标准:代码闭环优先 Codex,文档、研究、表格、演示或跨应用成果优先 Work。
很多人第一次用 Cursor,会让 Agent 直接“把这个功能做完”。它往往真能改出一堆文件,但你很难判断哪一处是对的,哪一处只是看起来像对的。 我更建议把第一次任务当成一次小型交接:选一个能看见、能测试、能回退的改动。Cursor 负责...
很多 AI 产品把对话框放在最前面。TraeWork 也有对话区,但它更像一张会持续更新的任务单:你给出目标、材料和验收条件,之后看任务怎么推进、交付了什么、还缺什么。 这个区别不在文案,而在使用习惯。问一个即时问题时,答案读完就结束了。处...
> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files ...
Andrej Karpathy 在 Stanford 的这场演讲,表面上是一场关于 Transformer、GPT 和提示工程的技术分享,真正值得留下的核心判断只有一句:软件正在从“人来设计算法”,转向“人来设计数据和语言程序”。模型能力越...
本文整理自 AI Engineer 大会上 Aviator 联合创始人 Ankit Jain 的演讲《How to Kill the Code Review》。他几个月前写过一套「杀死代码评审」的五层信任模型,这次上台主要做自我修正:评审从...
Agent 评估的重点正在从追逐能力上限转向守住行为底线。Ben Hylak 分享了生产问题发现、评估代码化,以及用确定性信号筛选异常的实践。
很多人搭知识库,第一步就开始设计目录、标签和模板。结果通常是:系统越来越漂亮,笔记越来越少。 Warp 开发者关系负责人 Ben Holmes 在一场分享里给出的顺序很反直觉:先别整理,先把想到的东西尽可能留下来。等原材料积累到一定规模,再...
AI 个人订阅只需要看两组对标:**ChatGPT Plus 对 Claude Pro,ChatGPT Pro 对 Claude Max 5× / Max 20×**。放在一张总表里,价格和额度关系会清楚很多。 月金额按一年 52 周折算:...
一个任务投送系统出现过两种症状。待执行任务进入 Kafka 的速度不够,数据库也频繁出现锁等待。两种症状来自同一段调度代码。 旧流程用一个线程逐条发送任务。整批投送又共用一个数据库事务。前面的任务已经改过状态,却要等批次尾部的任务发送结束。...
AI 竞争已经打到了第三层。第一层拼基础模型——GPT、Claude、Gemini 谁更强;第二层拼 Agent——Codex、Claude Code、Trae 谁更好用。DeepSeek 上周扔出一件新东西,直接把战场拉到了第三层:Har...
过去一年里,”让 AI 写测试优先”几乎成了 AI 编程的政治正确。绝大多数被传播的 CLAUDE.md、AGENTS.md、.cursorrules 里,都能找到一句”先写失败的测试,再写实现̶...
本周大模型圈最重要的信号不是又多了几个新模型,而是后训练、Agent能力和开源可用性同时加速。智谱、DeepSeek、Google、OpenAI和Anthropic都在用不同方式回答同一个问题:模型怎样从会聊天变成能稳定干活。