NTransformer 是一款高效能 C++/CUDA 推理引擎,通过创新的 PCIe 流式传输和 NVMe Direct I/O 技术,成功在单张 RTX 3090(24GB 显存)上流畅运行 Llama 3.1 70B 大模型。该技术完全绕过 CPU,利用三级自适应缓存(显存+内存+NVMe)和双缓冲流水线,将推理速度相比传统 mmap 方式提升了 33 倍。这一突破性优化极大降低了本地运行超大参数模型的硬件门槛。
NTransformer 是一款高效能 C++/CUDA 推理引擎,通过创新的 PCIe 流式传输和 NVMe Direct I/O 技术,成功在单张 RTX 3090(24GB 显存)上流畅运行 Llama 3.1 70B 大模型。该技术完全绕过 CPU,利用三级自适应缓存(显存+内存+NVMe)和双缓冲流水线,将推理速度相比传统 mmap 方式提升了 33 倍。这一突破性优化极大降低了本地运行超大参数模型的硬件门槛。