arXiv · Computer Vision· Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taix\'e, Sanja Fidler, Wenhu Chen, Zian Wang, Jay Zhangjie Wu·· 3 小时前AI 评分30
PixelUMM:无需编码器的统一图像与视频理解与生成模型
PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation
AI 导读
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间处理图像与视频。图像表示为空间图块,视频表示为时空管状块,通过单层线性投影连接原始像素与共享多模态骨干网络。其混合 Transformer 架构结合共享注意力与任务特定参数,支持自回归文本预测和像素空间流匹配,在图像与视频理解及生成任务上取得竞争力表现。
来源:arXiv · Computer Vision · arxiv.org