跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_

持续更新

更多文章

架构设计 #AI Agent 框架

Loop Engineering 是 Harness 的局部命名

最近一个词在 AI 圈被反复提起:Loop Engineering,循环工程。01Coder(小木头)做了一期视频把这件事讲了一遍,原视频在文末。我看完顺手对了一下自己手里这一年的笔记,想说一句直接点的:它没那么新,但 Boris Cher...

13 分钟阅读100 阅读
架构设计 #AI 模型横评

embeddings 是 cached compute

最近 Twitter 上的「RAG 已死」和 Google 上「RAG」的搜索曲线,方向是反的。前者一年比一年响,后者在 2025 年中段创了新高。两条线对不上,要么是社交媒体放大了少数派意见,要么是「RAG」这个词被两边人各说各话。 Tu...

12 分钟阅读65 阅读
架构设计 #AI Agent 框架

Prompt Learning 的两个反馈圈

最近半年,业界几乎所有团队都在抱怨 agent 不可靠。模型选了最贵的,工具调用接全了,上下文也尽量塞满,可输出依然时好时坏。换一个模型也救不回来。问题出在哪里? Arize 的 SallyAnn DeLucia 和 Fuad Ali 在 ...

17 分钟阅读75 阅读
架构设计

让 AI 代码审查工具不能再瞎引证

最近读了一个叫 Clawpatch 的开源项目源码,写一点感想。 本来没打算细看。它是个自动审代码的命令行工具——扫一遍仓库、找 bug、跑测试、顺手给个修复方案。这类工具 GitHub 上一搜几十个,听起来没什么特别。 读着读着我停下来了...

14 分钟阅读78 阅读
AI 大模型

Cowork 五条规则背后的同一件事

最近这半年,Anthropic 在做一件不太显眼但方向很清楚的事:把原本只有开发者会写的 CLAUDE.md、MEMORY.md、skills 这一整套工程化写法,整体搬到 Web 端给非开发者用。这个新产品叫 Claude Cowork,...

14 分钟阅读197 阅读
AI 大模型 #ChatGPT

Codex 在自己的执行历史里找补丁

最近社区在传一个”自我蒸馏”的提示词,源头是 OpenAI Codex 团队成员 @VB。意思是让 Codex 回看你最近 30 天的执行记录,把里面反复出现的工作流打包成 Skill,把固定角色封成 Sub-age...

8 分钟阅读143 阅读
AI 大模型 #AI 模型横评

LLM 排行榜的另一条轴

你打开任何一个 LLM 编码排行榜,看到的都是一排数字:82、84、86。看上去越高越好,对吧? 但如果你真把”得分最高”的那个模型搬进公司里写代码,运维很可能在周末打电话骂你。因为榜单只回答了”能不能跑...

8 分钟阅读126 阅读
AI 大模型

Claude Code Routines:把 Agent 从等待模式变成主动干活

去年,Anthropic 的文档工程师 Sarah 遇到了一个没法靠加班解决的问题:Claude Code 团队的 PR 合并量比年初增加了 200%,但维护文档的人只有她一个。每次有代码改动,她都要手动比对源码和文档有没有偏差,再开 PR...

7 分钟阅读206 阅读
AI 大模型

GPT-5.5 的提示词,从流程控制变成了结果验收

我注意到一件有意思的事:同样是用 GPT-5.5 或者 Codex,有的人能稳定跑完复杂任务,有的人则反复拿到跑偏的结果。差距不在模型能力,在于提示词的写法有没有跟上模型的进化方向。 灵姐(灵姐说AI)最近结合 OpenAI 官方的 Pro...

6 分钟阅读155 阅读