跳到正文
热点事件持续更新

OTROPE:基于最优传输的LLM鲁棒离线策略评估

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,arXiv 发表 OTROPE,提出一种无似然函数的离线评估方法,通过最优传输在语义空间对齐行为模型与目标模型的分布,结合校正后的人工标注残差与代理预测器实现双重鲁棒估计。理论分析解释了基线评估器在分布偏移下失效的原因,并在合成与真实 LLM 评测任务上验证其优于基线,使较弱评估器可接近或超越较强评估器,代码已开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Artificial Intelligence
    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    OTROPE 提出一种无似然函数的离线评估方法,通过最优传输在语义空间对齐行为模型与目标模型的分布,结合校正后的人工标注残差与代理预测器实现双重鲁棒估计。理论分析解释了基线评估器在分布偏移下失效的原因,并在合成与真实 LLM 评测任务上验证其优于基线,使较弱评估器可接近或超越较强评估器。代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。