跳到正文
原文
arXiv · Statistics Machine Learning· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Tianshu Fu, Daren Zha, Jun Xiao·· 3 小时前AI 评分36

FAER:可审计的效用对齐轨迹回放框架用于语言模型后训练

FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training

AI 导读

FAER 提出一种可审计的全轨迹回放框架,包含训练无关的固定选择器与基于独立校准块的 FAER-UTILITY 学习感知选择器。

来源:arXiv · Statistics Machine Learning · arxiv.org