跳到正文
原文
PyTorch Blog· Dev (Devashish) Shankar, Darren Liu, Chunzhi Yang, Jackie (Jiaqi) Xu,Markus Hoehnerbach, Jason Xie, Santosh Mohan, Han Xu, Rich Zhu, Josh Fromm, Hongtao Yu, Max Leung, John Bocharov, Alan Purvis·· 14 天前精选AI 评分67

PyTorch Blog:Low Precision Flash Attention 4 支持MXFP8前向与反向

Low Precision Flash Attention 4: End-to-End Block-Scaled Attention for Blackwell

AI 导读

PyTorch Blog发布Low Precision Flash Attention 4,在Blackwell上扩展MXFP8前向与反向,前向达2.85 PF/s、反向达2 PF/s,LLM形状较BF16加速1.6×和1.52×。代码已开源至ads_model_kernel_library/lp_fa4。

推荐理由

原文给出了MXFP8前向与反向的PFLOP/s数据及开源地址,读者可据此评估Blackwell训练栈的实际加速效果。

来源:PyTorch Blog · pytorch.org