arXiv · Statistics Machine Learning· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Tianshu Fu, Daren Zha, Jun Xiao·· 3 小时前AI 评分36
FAER:可审计的效用对齐轨迹回放框架用于语言模型后训练
FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training
AI 导读
FAER 提出一种可审计的全轨迹回放框架,包含训练无关的固定选择器与基于独立校准块的 FAER-UTILITY 学习感知选择器。
来源:arXiv · Statistics Machine Learning · arxiv.org