硬核实战:从双路4090到8GB老Mac,探索LLM本地部署的性能极限
这篇文章详细记录了作者在LLM部署方面的硬核折腾经历。从为了运行120B大模型而专门搭建双路4090平台,到转向vLLM框架实现190 TPS的高吞吐,作者不仅对比了Ollama与vLLM的性能差异,还实测了DeepSeek的1M长上下文能...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
这篇文章详细记录了作者在LLM部署方面的硬核折腾经历。从为了运行120B大模型而专门搭建双路4090平台,到转向vLLM框架实现190 TPS的高吞吐,作者不仅对比了Ollama与vLLM的性能差异,还实测了DeepSeek的1M长上下文能...