海光K100国产显卡实测:GPTQ/AWQ量化模型难以运行,全量版勉强可用
在国产化信创环境下,技术社区针对海光K100显卡进行了大模型部署实测。结果显示,目前主流的GPTQ-Int4和AWQ量化版本,由于依赖CUDA生态或vLLM与ROCm的兼容性问题,均无法正常运行。相比之下,全精度的BF16/FP16模型(如...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
在国产化信创环境下,技术社区针对海光K100显卡进行了大模型部署实测。结果显示,目前主流的GPTQ-Int4和AWQ量化版本,由于依赖CUDA生态或vLLM与ROCm的兼容性问题,均无法正常运行。相比之下,全精度的BF16/FP16模型(如...