跳到正文
原文
arXiv · Computer Vision· Zequn Yang, Yu Miao, Haotian Ni, Ziheng Chen, Chengxiang Huang, Dongzhan Zhou, Kai Chen, Qi Zhang, Ji-Rong Wen, Yake Wei, Di Hu·· 3 小时前AI 评分36

Gestalt:大 multimodal interplay 模型

Gestalt: Large Multimodal Interplay Model

AI 导读

summary_zh: Gestalt 提出一种基于 multimodal interplay 的大 multimodal 模型新范式,构建从模态专属处理、跨模态对齐到深层 multimodal 集成的多阶段金字塔结构。

来源:arXiv · Computer Vision · arxiv.org