跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
前沿哨所

旧显卡焕发新生:2080Ti成功部署Qwen 3.6 35B大模型,实测67 TPS与128k上下文

1 分钟阅读阅读(513)
赞助推荐 团队协作里的 AI 办公工作台

一位开发者利用 llama.cpp 成功将 35B 参数规模的 Qwen 3.6-A3B 模型部署到仅 11GB 显存的 RTX 2080Ti 显卡上。得益于 IQ1_M 超强量化技术,该模型实现了 128k 长上下文处理能力,单并发速度达 67 TPS。实测显示,其在 pi-coding-agent 中表现稳定,性能可媲美云端 Step 3.5 Flash,显著优于同规模的 27B 版本。这一案例展示了极致量化技术如何挖掘旧硬件潜力,为关注隐私和成本的用户提供了高性价比的本地大模型解决方案。

原文链接:Linux.do

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(2)
未经允许不得转载:80aj » 旧显卡焕发新生:2080Ti成功部署Qwen 3.6 35B大模型,实测67 TPS与128k上下文
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型