Lambda· Jianwen Xie·· 6 天前AI 评分42
构建用于空间推理的多模态模型:CVP 模型介绍
Building multimodal models for spatial reasoning
AI 导读
CVP 模型基于 LLaVA-Video-7B 和 Video-3D-LLM 的多视图表示构建,在 ScanQA、SQA3D、ScanRefer、Multi3DRefer 和 Scan2Cap 五个 3D 视觉语言基准上均超越 Video-3D-LLM 基线。
来源:Lambda · lambda.ai