Skip to content
PyTorch Blog· Dev (Devashish) Shankar, Darren Liu, Chunzhi Yang, Jackie (Jiaqi) Xu,Markus Hoehnerbach, Jason Xie, Santosh Mohan, Han Xu, Rich Zhu, Josh Fromm, Hongtao Yu, Max Leung, John Bocharov, Alan Purvis·· 22d agoSelectedAI score67

PyTorch Blog:Low Precision Flash Attention 4 支持MXFP8前向与反向

Low Precision Flash Attention 4: End-to-End Block-Scaled Attention for Blackwell

AI brief

PyTorch Blog发布Low Precision Flash Attention 4,在Blackwell上扩展MXFP8前向与反向,前向达2.85 PF/s、反向达2 PF/s,LLM形状较BF16加速1.6×和1.52×。代码已开源至ads_model_kernel_library/lp_fa4。

Why it matters

原文给出了MXFP8前向与反向的PFLOP/s数据及开源地址,读者可据此评估Blackwell训练栈的实际加速效果。

Source: PyTorch Blog · pytorch.org