Hot eventLive
PG-SFT提出通过特权引导的SFT平衡Agent能力获取与保留
1 reports1 sources3 hr ago updated
Get the story
AI overview
PG-SFT方法通过利用agent轨迹的回合级信息增益来调整监督强度,旨在离线Agent微调中平衡能力获取与保持。研究指出,标准SFT虽能提升目标benchmark但会导致非目标分数下降,而KL惩罚与限制更新幅度未能避免该退化趋势。PG-SFT的核心在于不仅锚定基座行为,更关注监督在何处及多强偏离基座行为,从而在目标benchmark提升的同时降低分布偏移与通用能力退化。
Generated from reports · updated 2 hr ago
LatestOct 2
PG-SFT提出通过回合级信息增益调整监督强度,平衡Agent能力获取与保留。Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · Artificial IntelligencePG-SFT:离线 Agent 微调中能力获取与保持的平衡
PG-SFT 通过利用 agent 轨迹的回合级信息增益调整监督强度,在目标 benchmark 提升的同时降低分布偏移与通用能力退化。标准 SFT 虽提升目标 benchmark 但导致非目标分数下降,KL 惩罚与限制更新幅度未能避免该退化趋势。平衡能力获取与保持不仅取决于是否锚定基座行为,还取决于监督在何处及多强偏离基座行为。
Heat trend
There is not enough continuous observation data to draw a trend yet.