AI Agent 做 TDD 有没有用: 实测排名与 3 倍 token 成本
过去一年里,”让 AI 写测试优先”几乎成了 AI 编程的政治正确。绝大多数被传播的 CLAUDE.md、AGENTS.md、.cursorrules 里,都能找到一句”先写失败的测试,再写实现̶...
标签索引
这个标签下有 1738 篇文章。按时间回看相关判断与实践记录。
标签精选
过去一年里,”让 AI 写测试优先”几乎成了 AI 编程的政治正确。绝大多数被传播的 CLAUDE.md、AGENTS.md、.cursorrules 里,都能找到一句”先写失败的测试,再写实现̶...
本周大模型圈最重要的信号不是又多了几个新模型,而是后训练、Agent能力和开源可用性同时加速。智谱、DeepSeek、Google、OpenAI和Anthropic都在用不同方式回答同一个问题:模型怎样从会聊天变成能稳定干活。
本文整理自「灵姐说AI」对 WorkBuddy、Kimi Work、千问办公和 TRAE Work 的同题实测。真正值得看的不是谁的界面更像 Codex,而是工作 Agent 进入日常流程后,什么才算可验证、可追责、可直接使用的交付。原视频...
本文整理自 OpenAI Dominik Kundel 在 AI Engineer World’s Fair 的演讲。它真正值得看的地方,不是 Codex 又多了几个功能,而是 OpenAI 正在把 coding agent 的关键能力从“...
Jason Liu 在 AI Engineer 的这场 Codex 工作坊,表面是在讲 appshots、skills、plugins、memory、automation 和 computer use,实际讲的是一个更大的转向:Agent ...
2026 年 7 月最后一周,大模型行业的主线很清楚:美国头部厂商用降价和生态补强防守,中国开源阵营继续用权重开放和性价比抢开发者心智,Agent 与具身智能开始从概念走向生产场景。
Tesla 机器学习工程师 Ishita Daga 在这段 12 分钟分享里,把企业数据 Agent 的失败原因压到三个词:歧义、腐败、偏好。本文结合我自己的 Harness / 企业记忆笔记,讨论为什么加模型、加上下文、加知识库都不是根治...
本文整理自 Google DeepMind 工程师 Philipp Schmid 在 AI Engineer 的演讲。核心问题不是 Skill 有没有用,而是没有 eval 的 Skill 无法判断何时该触发、何时该退休,也无法证明它真的让...
第37期大模型周报,记录2026年7月11日至17日这一周的几个关键信号:OpenAI把GPT-5.6推向企业代理,Anthropic继续押注开发者生态,Google走企业集成路线,中国开源模型则用Kimi K3和GLM系列把成本压力重新打...
Peter Yang 这期视频展示了 GPT-5.6 发布后,ChatGPT 桌面端如何从聊天工具变成管理邮件、日历、播客准备和网站发布的个人操作系统。这不只是一个工具教程,更是一套 AI 时代工作方式的落地样本。 Peter Yang 这...