Skip to content
arXiv · Machine Learning Theory· Bohan Lin, Liyi Chen, Zhuoning Guo, Muyang Li, Qimeng Wang, Yan Gao, Yao Hu, Yudong Zhang·· 4 hr agoAI score36

GraphOPD:面向 LLM 智能体的图增强在线策略蒸馏

GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents

AI brief

GraphOPD 提出将图结构增强引入 LLM 智能体的在线策略蒸馏,用环境状态变化记录构建依赖图,以随机游走稳态分布为步骤打分,并与教师-学生差异信号融合成轨迹级监督掩码。

Source: arXiv · Machine Learning Theory · arxiv.org