arXiv · Machine Learning Theory· Bohan Lin, Liyi Chen, Zhuoning Guo, Muyang Li, Qimeng Wang, Yan Gao, Yao Hu, Yudong Zhang·· 4 小时前AI 评分36
GraphOPD:面向 LLM 智能体的图增强在线策略蒸馏
GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents
AI 导读
GraphOPD 提出将图结构增强引入 LLM 智能体的在线策略蒸馏,用环境状态变化记录构建依赖图,以随机游走稳态分布为步骤打分,并与教师-学生差异信号融合成轨迹级监督掩码。
来源:arXiv · Machine Learning Theory · arxiv.org