跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引

显存优化

这个标签下有 8 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

AI 大模型

榨干每块显存:LLM 底层显存优化

作者:toy GPU 显存是 LLM 推理与训练的硬约束,不是软性资源。当一个 70B 参数模型以 BF16 格式加载时,光是参数本身就需要约 140GB,单张 H100 的 80GB 显存根本装不下。工程师的任务不是抱怨硬件贵,而是理解显...

106 分钟阅读288 阅读
前沿哨所

英伟达提出KVTC技术:无需修改模型,将LLM推理缓存压缩40倍

针对大规模 LLM 推理中 KV 缓存占用大量显存的问题,英伟达研究人员提出了一种名为 KVTC 的轻量级变换编码器。该技术借鉴经典媒体压缩算法,结合 PCA 特征去相关、自适应量化和熵编码,无需修改模型参数,仅通过简单校准即可实现高效的缓...

1 分钟阅读140 阅读
前沿哨所

拓扑Transformer问世:KV缓存减半,突破传统注意力机制

本文介绍了名为Tauformer的新型拓扑Transformer架构,它通过图拉普拉斯导出的标量替代传统的点积注意力,将域结构直接注入模型。这种设计使KV缓存只需存储值和标量流,而非完整的键张量,实现了约50%的逐层缓存缩减。在H100上的...

1 分钟阅读174 阅读