让 Agent 跑得快:LLM 推理服务
作者:toy 一个 Agent 工作流,最终的性能瓶颈往往不在路由逻辑、工具调用,而在 LLM 推理本身。同样的模型,同样的硬件,不同的推理框架可以带来 10 倍以上的吞吐差距。这篇文章讨论推理服务的底层机制,以及三个主流框架:vLLM、S...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
作者:toy 一个 Agent 工作流,最终的性能瓶颈往往不在路由逻辑、工具调用,而在 LLM 推理本身。同样的模型,同样的硬件,不同的推理框架可以带来 10 倍以上的吞吐差距。这篇文章讨论推理服务的底层机制,以及三个主流框架:vLLM、S...
本文详细记录了在魔改RTX 4090 48G显卡上,利用SGLang框架部署Qwen3.5-27B-FP8及35B-A3B模型的实战经验。测试表明,在WSL2环境下,该配置实现了单路50-60 tokens/s的处理速度,且KV缓存表现完美...