跳到正文
原文
arXiv · Artificial Intelligence· Wenxuan Wang, Zekai Liu, Weinan Zhang, Yu Cheng, Yang Yang·· 3 小时前AI 评分38

D-OPCD:用在线策略上下文蒸馏将智能体经验内化到扩散模型权重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

AI 导读

研究提出 Diffusion On-Policy Context Distillation(D-OPCD),把智能体改进后的提示词作为特权上下文,将 agent harness 的能力蒸馏进扩散模型权重。

来源:arXiv · Artificial Intelligence · arxiv.org