跳到正文
原文
Lambda· Jianwen Xie·· 6 天前AI 评分42

构建用于空间推理的多模态模型:CVP 模型介绍

Building multimodal models for spatial reasoning

AI 导读

CVP 模型基于 LLaVA-Video-7B 和 Video-3D-LLM 的多视图表示构建,在 ScanQA、SQA3D、ScanRefer、Multi3DRefer 和 Scan2Cap 五个 3D 视觉语言基准上均超越 Video-3D-LLM 基线。

来源:Lambda · lambda.ai