PyTorch Blog· Sean Chen (Red Hat) and Shangdi Yu (PyTorch, Meta Platforms)·· 3 小时前精选AI 评分62
vLLM 集成 Helion 构建高性能可移植线性后端
Building a High-Performance and Portable vLLM Linear Backend with Helion
AI 导读
Sean Chen 与 Shangdi Yu 将 Helion 集成到 vLLM 线性后端,用单一 GEMM 实现覆盖 Standard、Split-K 与 Swap-AB 变体,并通过 per-shape AOT autotuning 自动选择最优配置。
推荐理由
单篇 Helion GEMM 实现覆盖多种算法变体,读者可借此评估 autotuned DSL 在推理后端中的适用边界。
来源:PyTorch Blog · pytorch.org