跳到正文
原文
arXiv · Computer Vision· Eunji Shin, Dahyun Choi, Seungyeon Jo, Yejin Hong, Jiyoung Lee·· 4 小时前AI 评分30

TiTok:面向多片段时序定位的音视频大语言模型

TiTok: Audio-Visual LLM for Multi-Segment Temporal Grounding

AI 导读

研究者提出音视频大语言模型 TiTok,针对未剪辑视频中的音视频多片段时序定位(AV-MSG)问题,可为单个查询定位任意数量的时间片段。

来源:arXiv · Computer Vision · arxiv.org