热点事件持续更新
Recovering Off-Policy Supervision for Speculative Decoding
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026-10-01 论文提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被离策略 token 破坏的监督信号。在固定视觉语言和文本语料上,贪婪接受长度较 DFlash 最高提升 36.5%,单轮即超越最佳擦除策略,三轮后达到目标重生成响应的接受长度。代码已开源。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 12:00
论文提出 ALR 与 IRA 框架,贪婪接受长度较 DFlash 最高提升 36.5%,代码已开源。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv · Computation and Language精选Recovering Off-Policy Supervision for Speculative Decoding
论文提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被离策略 token 破坏的监督信号。在固定视觉语言和文本语料上,贪婪接受长度较 DFlash 最高提升 36.5%,单轮即超越最佳擦除策略,三轮后达到目标重生成响应的接受长度。代码已开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。