消费级显卡的逆袭:开源框架 RoundPipe 突破 PCIe 瓶颈,4090 多卡训练提速 25 倍
针对消费级显卡(如 RTX 4090)在多卡并行训练大模型时受限于 PCIe 带宽导致效率低下的问题,一项名为 RoundPipe 的开源框架方案应运而生。该框架无需昂贵的 NVLink 支持,通过优化算法克服通信瓶颈,显著提升了多卡并行效...
标签索引
这个标签下有 15 篇文章。按时间回看相关判断与实践记录。
标签精选
针对消费级显卡(如 RTX 4090)在多卡并行训练大模型时受限于 PCIe 带宽导致效率低下的问题,一项名为 RoundPipe 的开源框架方案应运而生。该框架无需昂贵的 NVLink 支持,通过优化算法克服通信瓶颈,显著提升了多卡并行效...
Datalog 是一种常用于知识图谱和演绎数据库的声明式逻辑编程语言。这篇来自 ACM 的文章深入探讨了如何克服传统 CPU 在处理大规模逻辑推理时的性能瓶颈。通过重新设计底层数据结构和执行模型,研究人员使 Datalog 能够充分利用 G...
AI独角兽DeepSeek在GitHub提前发布了完全重构的专家并行通信库DeepEP v2。新版本旨在解决初代产品的技术债务,在延续V3配置的测试中,不仅将峰值性能提升至1.3倍,更将GPU流处理器资源占用降低了4倍。架构上,v2版弃用N...
Lucebox项目展示了如何通过“手写内核”挖掘硬件潜力,而非依赖新一代芯片。开发团队通过重写CUDA内核和引入DFlash投机解码技术,在RTX 3090显卡上成功运行Qwen3.5-27B模型,推理速度达到207 tok/s,相比传统方...
普林斯顿 AI Lab Fellow、前字节跳动研究员 Yifan Zhang 近日透露,中国 AI 独角兽 DeepSeek 的下一代旗舰模型 V4 可能于下周发布。尽管 DeepSeek 官方尚未回应,但 Zhang 凭借其清华姚班及普...
传统的编程思维往往认为更高的浮点数精度(如从32位到64位)总是更好的,但在现代GPU和AI计算领域,这一逻辑正在被颠覆。文章探讨了4位浮点数(FP4)这一前沿技术,指出在深度学习推理和训练中,通过降低精度可以大幅提升内存带宽和计算吞吐量。...
近日,一款基于 Naga IR 构建的 WebGPU Shader 代码压缩工具在技术社区发布。作为一个高效的源到源(S2S)编译器,该工具通过深度优化代码生成逻辑,号称能提供目前业界最高的压缩比,有助于显著减小 3D Web 应用的体积并...
近日,一款名为InCoder-32B(IndustrialCoder)的AI模型在技术社区引发关注。该模型专为工业级场景打造,其核心亮点在于突破了通用编程的范畴,深入到了芯片设计、GPU内核优化、嵌入式系统及编译器优化等高门槛领域。开发者对...
本研究由MIT、UC Berkeley及NVIDIA等机构联合发布,旨在解决经典K-means聚类算法在现代GPU上的性能瓶颈。现有实现常受限于显存(HBM)的数据搬运瓶颈及硬件级的原子写入冲突。团队提出的Flash-KMeans引入了“F...
本资源体系化地拆解了大模型(LLM)推理优化的关键技术路径。内容涵盖从基础推理原理、KV Cache机制到PagedAttention、FlashAttention等运行时加速方案;深入剖析了AWQ、GPTQ等模型量化与压缩技术,并提供了v...