惨痛教训:为何GPU上的Flash Attention优化策略在TPU上彻底失效?
本文记录了作者尝试将基于GPU Triton编写的Flash Attention算法移植到Google TPU (JAX)上的失败与顿悟过程。起初,直接移植的性能不仅没有提升,反而比标准的XLA融合内核慢了数十倍。通过深入剖析TPU架构和J...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
本文记录了作者尝试将基于GPU Triton编写的Flash Attention算法移植到Google TPU (JAX)上的失败与顿悟过程。起初,直接移植的性能不仅没有提升,反而比标准的XLA融合内核慢了数十倍。通过深入剖析TPU架构和J...