arXiv · Computer Vision· Zequn Yang, Yu Miao, Haotian Ni, Ziheng Chen, Chengxiang Huang, Dongzhan Zhou, Kai Chen, Qi Zhang, Ji-Rong Wen, Yake Wei, Di Hu·· 3 小时前AI 评分36
Gestalt:大 multimodal interplay 模型
Gestalt: Large Multimodal Interplay Model
AI 导读
summary_zh: Gestalt 提出一种基于 multimodal interplay 的大 multimodal 模型新范式,构建从模态专属处理、跨模态对齐到深层 multimodal 集成的多阶段金字塔结构。
来源:arXiv · Computer Vision · arxiv.org