跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

性能优化

这个标签下有 201 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

架构设计

从单线程长事务到并行短事务:任务投送链路的修复方法

一个任务投送系统出现过两种症状。待执行任务进入 Kafka 的速度不够,数据库也频繁出现锁等待。两种症状来自同一段调度代码。 旧流程用一个线程逐条发送任务。整批投送又共用一个数据库事务。前面的任务已经改过状态,却要等批次尾部的任务发送结束。...

12 分钟阅读70 阅读
AI 大模型 #ChatGPT

Codex 磁盘占用异常: 失控写盘的根因与排查清理

“Codex 会把磁盘给烧了吗?” 这句听上去夸张的吐槽,背后其实是一个很现实的问题: 当你把一个能自己读写文件、跑命令、装依赖、起容器的自主编程 agent 放到本地长时间运行,它确实有可能在你不注意的时候把磁盘占...

23 分钟阅读861 阅读
架构设计 #AI Agent 框架

Prompt Learning 的两个反馈圈

最近半年,业界几乎所有团队都在抱怨 agent 不可靠。模型选了最贵的,工具调用接全了,上下文也尽量塞满,可输出依然时好时坏。换一个模型也救不回来。问题出在哪里? Arize 的 SallyAnn DeLucia 和 Fuad Ali 在 ...

17 分钟阅读75 阅读
AI 大模型

榨干每块显存:LLM 底层显存优化

作者:toy GPU 显存是 LLM 推理与训练的硬约束,不是软性资源。当一个 70B 参数模型以 BF16 格式加载时,光是参数本身就需要约 140GB,单张 H100 的 80GB 显存根本装不下。工程师的任务不是抱怨硬件贵,而是理解显...

106 分钟阅读290 阅读
AI 大模型

让 Agent 跑得快:LLM 推理服务

作者:toy 一个 Agent 工作流,最终的性能瓶颈往往不在路由逻辑、工具调用,而在 LLM 推理本身。同样的模型,同样的硬件,不同的推理框架可以带来 10 倍以上的吞吐差距。这篇文章讨论推理服务的底层机制,以及三个主流框架:vLLM、S...

90 分钟阅读184 阅读