跳到正文
热点事件持续更新

FluidPD:支持SLO感知的预填充-解码分离LLM服务就地弹性伸缩

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

FluidPD 是一个面向 Prefill-Decode 分离式 LLM 推理的系统,主打 SLO 感知的就地弹性。为应对瞬时负载失衡,它通过 FluidToken 将有限比例的 prefill 计算卸载到有空闲余量的 decode worker;为应对持续性失衡,它通过 FluidRole 在不重载模型、不重启引擎的情况下,就地切换运行中 worker 的 prefill/decode 角色。该机制据称可在满足 SLO 的同时提升资源利用弹性。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Artificial Intelligence
    FluidPD:面向 SLO 感知 Prefill-Decode 分离式 LLM 推理的就地弹性机制

    FluidPD 是一个 Prefill-Decode 分离式 LLM 推理系统,提供 SLO 感知的就地弹性。它通过 FluidToken 将有限比例的 prefill 计算卸载到有空闲余量的 decode worker 处理瞬时失衡,通过 FluidRole 在不重载模型、不重启引擎的情况下就地切换运行中 worker 的 prefill/decode 角色应对持续失衡。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。