CLAUDE.md 怎么写: 提升 Claude Code 准确率的最小有效配置
社区里流传一句很有冲击力的话:某个项目把 Claude Code 的「准确率从 41% 升到 89%」,靠的只是改了一个 CLAUDE.md。这个数字来自热点原帖的说法,没有公开的评测方法和样本量,我们不把它当作实测基准。但它指向的那件事是...
AI 情报局 / 第 5 页
大模型、AI Agent、模型评测与产业动态。
本栏重点
社区里流传一句很有冲击力的话:某个项目把 Claude Code 的「准确率从 41% 升到 89%」,靠的只是改了一个 CLAUDE.md。这个数字来自热点原帖的说法,没有公开的评测方法和样本量,我们不把它当作实测基准。但它指向的那件事是...
“Codex 会把磁盘给烧了吗?” 这句听上去夸张的吐槽,背后其实是一个很现实的问题: 当你把一个能自己读写文件、跑命令、装依赖、起容器的自主编程 agent 放到本地长时间运行,它确实有可能在你不注意的时候把磁盘占...
TL;DR 一句话定义:vibe coding 想到哪写到哪,靠语义直觉驱动模型补全;spec coding 先写规格、定接口和验收,再让模型按规约实现。前者原型阶段真的快,后者在三天后你还认得自己代码这事上无可替代。 长项目的分水岭只有一...
TL;DR 把 GLM-5.2 和 GPT-5.5 摆在一起看, 不是为了分胜负, 而是帮工程团队定位”什么场景该用谁”。一句话: GPT-5.5 在通用推理、Agent 工具调用与生态成熟度上仍是基线, GLM-5...
写这篇之前,我先把过去半年在自己机器上跑过的 AI 编程 Agent 拉了一份清单: Claude Code、Codex、Cursor、Cline、Aider、Kilocode,以及最近 linux.do 圈讨论比较多的两款新兴 Agent...
上一篇拆了 Anthropic CEO 达里奥·阿莫迪(Dario Amodei)这期访谈的前半段:一家 AI 公司怎么把商业模式和价值观对齐。从访谈第 28 分钟开始,话题拐了一个弯,火力也猛了一个档。前半段聊的是公司怎么赚钱,后半段聊的...
大多数公司是先想清楚”做什么生意能赚钱”,再找一套说辞把它包装成使命。Anthropic 反过来:先定下”要把强大的 AI 做得安全”这条死规矩,再倒推什么样的生意不会跟它打架。在 Bloom...
上周五,美国政府做了一件很反常的事:它逼着本国最领先的一家 AI 公司,把最先进的产品从市场上撤下来。首当其冲的是 Anthropic,它的前沿模型叫 Mythos,对外卖的那个版本叫 Fable。据报道,留给公司执行的时间,大约只有九十分...
很多人在 Vercel AI SDK 或多模型调用链里看到 AI_ProviderSpecificError(也写成 ProviderSpecificError、AI_ProviderSpecific...)时,第一反应是去官方文档搜这个类...
豆包是字节跳动的 AI 助手,2024 年 5 月上线,背后是 Doubao-Seed 系列大模型。它在国内是装机量最大的 AI 应用之一,但「好用」和「值不值得你用」是两件事。 我把豆包当主力工具用了一段时间,也拿同样的任务喂给 Chat...
ppt-web 是 CallStorm 在 ppt-master 之上做的二次开发, 把命令行 PPT 生成器包成 FastAPI + React + Docker 的 web 服务。本文拆解架构、流水线、Claude Code 角色, 给...
把 Codex CLI 与 Cursor 的套餐拆开看: 每月多少钱、能跑多少请求、Agent 模式怎么算额度、谁更适合长任务谁更适合 IDE 内联编辑, 给出一份给真实开发者的选型清单。 最近半年, 选 Codex CLI 还是选 Cur...
Codex CLI 跑着跑着 MCP 服务器断了, 看上去像是被 logout 吞了 session。这篇从 stdio 长会话断连、provider 切换丢 MCP、ChatGPT auth 卡 codex_apps、mcp logout...
本地大模型怎么选:Qwen3.6 27B BF16 与 Step3.7 IQ4_XS 横评,从量化精度、显存账、编码 benchmark、Agent 适配、推理速度五个维度给一张选型矩阵,附四类使用者落地建议。
作者:toy | 覆盖周期:2026.06.13 – 06.19 卷首语 本周是 2026 年第一次能清楚看到”治理变量”压过”模型变量”的一周。 周一晚 OpenAI 被 42 个州的检察长...
我最近看了 Austin Marchese 解读 Karpathy 在 AISN 2026 上的发言,被里面一个反常识的小例子卡住了:你问 AI “我去 50 米外的洗车店该开车还是走路”,Claude、Gemini...
我先给一种失败模式起个名字:隐性失败。没有报错,没有警告,没有任何异常提示,你拿到的只是一个错答案。 这是 Bright Data 的 Rafael Levi 在 AI Engineer 大会上一场演讲的主题。他做的是帮 agent 大规模...
写过几年代码评审工具的人都知道,PR Review 真正的瓶颈不是 LLM 的输出能力,而是 LLM 看不见的上下文——一个改动在跨文件、跨模块、跨服务之后真正影响了什么。 最近这一年,AI Code Review 的产品越冒越多:PR-A...
过去三年,做”语言+图像”的人几乎都在重复一个动作:拿一个已经训得很大的语言模型,死死冻住它,然后在它前面接一个很小的转接头,把图像、视频、传感器数据翻译成它认识的”词”。听起来像凑合,但这条...
Paul 这一讲一开场就先打了个预防针:今天讲的是高度浓缩版的内容,MIT 隔壁的 ALP 那门课才是正经讲大模型,这里只是个高空俯瞰。听到一半我反而觉得,这种”俯瞰”才是真正值钱的。他把一个被无数公众号、技术博客、...