旧显卡焕发新生:2080Ti成功部署Qwen 3.6 35B大模型,实测67 TPS与128k上下文
一位开发者利用 llama.cpp 成功将 35B 参数规模的 Qwen 3.6-A3B 模型部署到仅 11GB 显存的 RTX 2080Ti 显卡上。得益于 IQ1_M 超强量化技术,该模型实现了 128k 长上下文处理能力,单并发速度达...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
一位开发者利用 llama.cpp 成功将 35B 参数规模的 Qwen 3.6-A3B 模型部署到仅 11GB 显存的 RTX 2080Ti 显卡上。得益于 IQ1_M 超强量化技术,该模型实现了 128k 长上下文处理能力,单并发速度达...