惨痛教训:为何GPU上的Flash Attention优化策略在TPU上彻底失效?
本文记录了作者尝试将基于GPU Triton编写的Flash Attention算法移植到Google TPU (JAX)上的失败与顿悟过程。起初,直接移植的性能不仅没有提升,反而比标准的XLA融合内核慢了数十倍。通过深入剖析TPU架构和J...
标签索引
这个标签下有 4 篇文章。按时间回看相关判断与实践记录。
标签精选
本文记录了作者尝试将基于GPU Triton编写的Flash Attention算法移植到Google TPU (JAX)上的失败与顿悟过程。起初,直接移植的性能不仅没有提升,反而比标准的XLA融合内核慢了数十倍。通过深入剖析TPU架构和J...
该话题探讨了在Modal平台上部署Qwen3-TTS模型时遇到的工程瓶颈。核心问题在于编译flash-attn组件时的资源权衡:单核编译耗时极长,而开启多核编译则极易触发内存溢出(OOM)。这一案例真实反映了当前AI开发者在云端部署大模型时...
TL;DR 推理才是大模型的真正战场——训练一次,推理百万次。标准Attention的内存带宽成为瓶颈,Flash Attention通过Tiling技术让速度提升5倍;KV Cache让解码快10倍,但长上下文会吃掉几十GB显存;vLLM...
本文深入探讨了作者如何使用Triton语言重新实现FlashAttention算法,以揭示其性能优化背后的技术细节。文章从第一原理出发,实现FlashAttention v1,并通过Nsight Compute分析性能瓶颈,如内存访问模式和...