4090 48G魔改实战:利用SGLang高效部署Qwen3.5,FP8推理性能卓越
本文详细记录了在魔改RTX 4090 48G显卡上,利用SGLang框架部署Qwen3.5-27B-FP8及35B-A3B模型的实战经验。测试表明,在WSL2环境下,该配置实现了单路50-60 tokens/s的处理速度,且KV缓存表现完美...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
本文详细记录了在魔改RTX 4090 48G显卡上,利用SGLang框架部署Qwen3.5-27B-FP8及35B-A3B模型的实战经验。测试表明,在WSL2环境下,该配置实现了单路50-60 tokens/s的处理速度,且KV缓存表现完美...