推理慢不在语言慢,慢在加载、量化和调度
你可能听过一个直觉:C++ 比 Python 快很多倍,所以 llama.cpp(C++ 写的)应该比 vLLM(Python 写的)快很多倍。实测打脸——同一个模型同一张卡,vLLM 在不少场景下比 llama.cpp 还快。这就是 Ca...
标签索引
这个标签下有 4 篇文章。按时间回看相关判断与实践记录。
标签精选
你可能听过一个直觉:C++ 比 Python 快很多倍,所以 llama.cpp(C++ 写的)应该比 vLLM(Python 写的)快很多倍。实测打脸——同一个模型同一张卡,vLLM 在不少场景下比 llama.cpp 还快。这就是 Ca...
ZSE是一款全新的开源大语言模型推理引擎,主打极致的内存效率与高性能。其核心创新包括自研的zAttention注意力机制、INT2-8混合精度量化以及zStream层级流式传输技术,允许在仅24GB显存的消费级显卡上运行700亿参数模型。实...
本文由 DeepSeek 技术报告贡献者撰写,通过 Nano-vLLM(仅1200行代码)深入剖析了 vLLM 的核心原理。文章详细讲解了 LLM 推理的流水线架构,包括请求调度、Prefill/Decode 双阶段处理、批处理与延迟的权衡...
Prisma是一个开源项目,基于Google Gemini 3模型开发的多专家并行推理引擎,支持动态规划技术。通过并行处理多个专家模型,实现了更高的推理效率和准确性,部分性能指标超越Gemini DeepThink。项目采用React、Ty...