Skip to content
arXiv · Artificial Intelligence· Wenxuan Wang, Zekai Liu, Weinan Zhang, Yu Cheng, Yang Yang·· 4 hr agoAI score38

D-OPCD:用在线策略上下文蒸馏将智能体经验内化到扩散模型权重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

AI brief

研究提出 Diffusion On-Policy Context Distillation(D-OPCD),把智能体改进后的提示词作为特权上下文,将 agent harness 的能力蒸馏进扩散模型权重。

Source: arXiv · Artificial Intelligence · arxiv.org