跳到正文
热点事件持续更新

Recovering Off-Policy Supervision for Speculative Decoding

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-01 论文提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被离策略 token 破坏的监督信号。在固定视觉语言和文本语料上,贪婪接受长度较 DFlash 最高提升 36.5%,单轮即超越最佳擦除策略,三轮后达到目标重生成响应的接受长度。代码已开源。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Computation and Language精选
    Recovering Off-Policy Supervision for Speculative Decoding

    论文提出基于 rollout 的训练框架,通过 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被离策略 token 破坏的监督信号。在固定视觉语言和文本语料上,贪婪接受长度较 DFlash 最高提升 36.5%,单轮即超越最佳擦除策略,三轮后达到目标重生成响应的接受长度。代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。