跳到正文
原文
arXiv · Computer Vision· Xiaoyu Wu, Yifei Wang, Chen Wei·· 5 小时前AI 评分35

Representation by Design in Generation: Diffusion Transformers 中的跨视角类别 Token 对齐

Representation by Design in Generation: Cross-View Class-Token Alignment in Diffusion Transformers

AI 导读

summary_zh: 该研究在 Diffusion Transformer 预训练中引入跨视角类别 Token 对齐,将两个独立加噪的双时间步观测的类别 Token 表示与 EMA-teacher 目标对齐,与流匹配和局部 patch 目标联合优化。

来源:arXiv · Computer Vision · arxiv.org