消费级显卡突围:实测Qwen3.6 APEX量化方案,20G显存实现高性能本地部署
本文评测了基于llama.cpp的Qwen3.6-35B-A3B-APEX模型在消费级显卡上的部署表现。实测数据显示,通过高效的APEX量化,模型总显存占用控制在18.6GB左右,使其能在2080Ti等20G显存显卡上流畅运行。在信息抽取与...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
本文评测了基于llama.cpp的Qwen3.6-35B-A3B-APEX模型在消费级显卡上的部署表现。实测数据显示,通过高效的APEX量化,模型总显存占用控制在18.6GB左右,使其能在2080Ti等20G显存显卡上流畅运行。在信息抽取与...