跳到正文
热点事件持续更新

HARPO:幻觉感知强化学习框架

1 篇报道1 个报道来源16 小时前 更新

先了解这件事

AI 综述

2026年10月5日,arXiv Computation and Language 发布一手报道,介绍名为 HARPO 的强化学习框架。该框架通过幻觉感知生成奖励模型 HA-GRM 与选择性激活机制 SAM,在大语言模型中同时优化忠实性与创造性。报道给出实验数据:基于 Qwen3-4B 的 HA-GRM 在 RAGTruth 上取得 78.08% 的 response-level F1,高于 SFT 基线的 66.37%。目前仅有这一篇报道,事件尚处于论文发布阶段,无后续验证或应用进展。

AI 根据报道生成 · 16 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv · Computation and Language
    HARPO:面向忠实与创造性语言生成的幻觉感知强化学习框架

    HARPO 是一种强化学习框架,通过幻觉感知生成奖励模型 HA-GRM 与选择性激活机制 SAM,在大语言模型中同时优化忠实性与创造性。基于 Qwen3-4B 的 HA-GRM 在 RAGTruth 上取得 78.08% 的 response-level F1,高于 SFT 基线的 66.37%。

本事件热度走势

当前热度 7·可比范围峰值 10(10月5日 13:00)·近 24 小时可比范围变化 –

02.557.51010月5日13:0010月5日18:0010月5日22:0010月6日03:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。