热点事件持续更新
PG-SFT提出通过特权引导的SFT平衡Agent能力获取与保留
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
PG-SFT方法通过利用agent轨迹的回合级信息增益来调整监督强度,旨在离线Agent微调中平衡能力获取与保持。研究指出,标准SFT虽能提升目标benchmark但会导致非目标分数下降,而KL惩罚与限制更新幅度未能避免该退化趋势。PG-SFT的核心在于不仅锚定基座行为,更关注监督在何处及多强偏离基座行为,从而在目标benchmark提升的同时降低分布偏移与通用能力退化。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 12:00
PG-SFT提出通过回合级信息增益调整监督强度,平衡Agent能力获取与保留。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv · Artificial IntelligencePG-SFT:离线 Agent 微调中能力获取与保持的平衡
PG-SFT 通过利用 agent 轨迹的回合级信息增益调整监督强度,在目标 benchmark 提升的同时降低分布偏移与通用能力退化。标准 SFT 虽提升目标 benchmark 但导致非目标分数下降,KL 惩罚与限制更新幅度未能避免该退化趋势。平衡能力获取与保持不仅取决于是否锚定基座行为,还取决于监督在何处及多强偏离基座行为。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。