硬核实战:从双路4090到8GB老Mac,探索LLM本地部署的性能极限
这篇文章详细记录了作者在LLM部署方面的硬核折腾经历。从为了运行120B大模型而专门搭建双路4090平台,到转向vLLM框架实现190 TPS的高吞吐,作者不仅对比了Ollama与vLLM的性能差异,还实测了DeepSeek的1M长上下文能...
标签索引
这个标签下有 2 篇文章。按时间回看相关判断与实践记录。
标签精选
这篇文章详细记录了作者在LLM部署方面的硬核折腾经历。从为了运行120B大模型而专门搭建双路4090平台,到转向vLLM框架实现190 TPS的高吞吐,作者不仅对比了Ollama与vLLM的性能差异,还实测了DeepSeek的1M长上下文能...
安大略省数字服务(ODS)曾试图引入大语言模型(LLM)来改善公共服务,但最终未能成功采购。作者指出,阻碍并非技术能力,而是责任风险——对于政府而言,98%的安全率等同于0%的可部署性。文章提出了一种“处方笺模式”,主张在基础设施层面而非提...