热点事件持续更新
FluidPD:支持SLO感知的预填充-解码分离LLM服务就地弹性伸缩
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
FluidPD 是一个面向 Prefill-Decode 分离式 LLM 推理的系统,主打 SLO 感知的就地弹性。为应对瞬时负载失衡,它通过 FluidToken 将有限比例的 prefill 计算卸载到有空闲余量的 decode worker;为应对持续性失衡,它通过 FluidRole 在不重载模型、不重启引擎的情况下,就地切换运行中 worker 的 prefill/decode 角色。该机制据称可在满足 SLO 的同时提升资源利用弹性。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
arXiv 论文介绍 FluidPD:FluidToken 卸载瞬时失衡,FluidRole 就地切换角色应对持续失衡。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Artificial IntelligenceFluidPD:面向 SLO 感知 Prefill-Decode 分离式 LLM 推理的就地弹性机制
FluidPD 是一个 Prefill-Decode 分离式 LLM 推理系统,提供 SLO 感知的就地弹性。它通过 FluidToken 将有限比例的 prefill 计算卸载到有空闲余量的 decode worker 处理瞬时失衡,通过 FluidRole 在不重载模型、不重启引擎的情况下就地切换运行中 worker 的 prefill/decode 角色应对持续失衡。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。