让 Agent 跑得快:LLM 推理服务
作者:toy 一个 Agent 工作流,最终的性能瓶颈往往不在路由逻辑、工具调用,而在 LLM 推理本身。同样的模型,同样的硬件,不同的推理框架可以带来 10 倍以上的吞吐差距。这篇文章讨论推理服务的底层机制,以及三个主流框架:vLLM、S...
AI 情报局 / 第 7 页
大模型、AI Agent、模型评测与产业动态。
本栏重点
作者:toy 一个 Agent 工作流,最终的性能瓶颈往往不在路由逻辑、工具调用,而在 LLM 推理本身。同样的模型,同样的硬件,不同的推理框架可以带来 10 倍以上的吞吐差距。这篇文章讨论推理服务的底层机制,以及三个主流框架:vLLM、S...
作者:toy 一、为什么需要微调 Prompt Engineering 的三类失效 用 Prompt 调教通用模型,是大多数 Agent 项目的第一站。这条路走得顺时,能省掉大量工程复杂度。但在三类场景下,它会系统性失效。 第一类是领域术语...
作者:toy 一、Agent 为什么需要记忆 无状态 LLM 的根本局限 把一个 LLM 想象成一位每隔五分钟就会彻底失忆的顾问。你在上午告诉他你的背景、偏好、当前项目的约束条件,五分钟后他已经一无所知,对话只能从头开始。这不是比喻,而是 ...
作者:toy 一、工具调用是什么:让模型伸手摸真实世界 从纯文本生成到”有手有脚” 大语言模型在工具调用出现之前,本质上是一台极其复杂的文字处理机器。你问它”今天北京的 PM2.5 是多少”,...
作者:toy 一、为什么需要 Agent 框架 从”手写循环”到框架 构建一个最简单的 ReAct Agent,大概需要五十行 Python:一个 while 循环,调 LLM,解析输出,调工具,把结果塞回上下文,再...
作者:toy 大多数人第一次看到 ChatGPT 流式输出时,误以为模型在”思考”。实际上它在做一件更机械的事:每次预测下一个 token 的概率分布,然后采样。这个过程里没有回溯,没有规划,没有对全局的感知。一个字...
作者:toy 一、智能体不是聊天机器人 有一个误解在 2025 年前后反复出现:只要套上”AI Agent”的名字,就算 Agent 了。实则不然。一个每次都从零开始的对话框,无论填了多么精心的 system pro...
作者:toy | 覆盖周期:2026.5.16 – 2026.5.29 这一周,AI 公司密集地按下了两个按钮:上市和融资。OpenAI 在 5 月 22 日向 SEC 秘密递交了招股书,目标估值最高一万亿美元;六天后,Anthropic ...
Anthropic 今天发布了 Claude Opus 4.8。价格没变,跑分照常往上走,这本来是一次很常规的小版本升级。但发布稿里花了不小的篇幅讲一件事:这个模型更”诚实”了。 诚实度被拿出来当主打,这是个值得留意...
最近 GitHub 上 spec-driven 工具一片虚火。OpenSpec、SpecKit、BMAD 一字排开,每个都说自己是”让 AI 不再 vibe coding 的那一个”。WorldofAI 频道这周又加...
你可能听过一个直觉:C++ 比 Python 快很多倍,所以 llama.cpp(C++ 写的)应该比 vLLM(Python 写的)快很多倍。实测打脸——同一个模型同一张卡,vLLM 在不少场景下比 llama.cpp 还快。这就是 Ca...
本文整理自 Flinn AI 的一场短讲。演讲者把 Harvey、Cursor、Claude 和 Manus/Manifold 放在一起比较,最后提炼出四个正在反复出现的 agent 产品原则:模式收敛、过程透明、个性化理解,以及可逆性设计...
本文整理自灵姐说AI对 Google I/O 2026 的深度解读。比起逐条数发布会功能,更值得看的是一个更大的判断:OpenAI 正在做超级 App,而 Google 想把 Gemini 塞进搜索、Workspace、YouTube、An...
本文整理自 Zihao Zhang 对开源具身智能训练链路的完整演示。更值得看的,不是某个机器人 demo 又做成了什么动作,而是一个更关键的信号:今天个人开发者已经可以用两千多块的机械臂、开源 VLA 模型和现成训练框架,真正跑通一条具身...
作者:toy | 覆盖周期:2026.5.9 – 2026.5.15 本周三件事值得拎出来单独讲:Anthropic 的 Claude Mythos Preview 把”AI 能不能找零日”这个老问题往前推了一大步;...
最近一年,一个很明显的变化是:工程实现越来越快,真正拖慢团队的,开始不是“写不出来”,而是“还没想清楚该写什么”。这段题为《Designing with Claude: From prompt to production》的分享,讲的就是这...
Demis Hassabis 在 Sequoia Capital 做了一场对话,聊了将近半小时。标题挺吸引眼球——"我们离 AGI 还有四分之三的路程"——但如果你期待的是某个技术突破的发布,这场对话给出的东西其实更安静,也更值得咀嚼。 H...
最近我越来越觉得,AI 编程已经不只是“写代码更快”这件事了。它正在把软件开发往另一个方向推:人不再主要亲手敲代码,而是开始搭建上下文、制定边界、分配风险,并同时管理一群会干活的代理。 这篇文章整理自 Spotify 和 Anthropic...
Anthropic 五月十四号发了一篇长文,叫《How Claude Code works in large codebases》,是他们《Claude Code at scale》系列的第一篇。这是官方第一次系统化地把”大型代...
软件分发原本只有两种主流颗粒度:一个是代码包(npm/pip/Docker),一个是 SaaS 帐号。最近半个月,我观察到第三种颗粒度正在固化下来——Plugin。OpenAI 给 Codex 加了 Plugin marketplace,A...