跳到正文
原文
Together AI·· 2026-03-05精选AI 评分72

FlashAttention-4:面向 Blackwell 非对称硬件的算法与 Kernel 协同设计

FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling

AI 导读

FlashAttention-4 在 B200 上 BF16 最高达 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3×、比 Triton 快 2.7×。通过前向 softmax 与 MMA 重叠、TMEM 缓存中间结果、2-CTA MMA 降共享内存流量,以及确定性模式提升可复现性。

推荐理由

原文给出了 B200 上的具体吞吐数据和对比倍数,读者可据此评估 FlashAttention-4 在实际训练中的加速潜力。

来源:Together AI · together.ai