arXiv · Artificial Intelligence· Wenxuan Wang, Zekai Liu, Weinan Zhang, Yu Cheng, Yang Yang·· 3 小时前AI 评分38
D-OPCD:用在线策略上下文蒸馏将智能体经验内化到扩散模型权重
Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation
AI 导读
研究提出 Diffusion On-Policy Context Distillation(D-OPCD),把智能体改进后的提示词作为特权上下文,将 agent harness 的能力蒸馏进扩散模型权重。
来源:arXiv · Artificial Intelligence · arxiv.org