arXiv · Computer Vision· Eunji Shin, Dahyun Choi, Seungyeon Jo, Yejin Hong, Jiyoung Lee·· 4 hr agoAI score30
TiTok:面向多片段时序定位的音视频大语言模型
TiTok: Audio-Visual LLM for Multi-Segment Temporal Grounding
AI brief
研究者提出音视频大语言模型 TiTok,针对未剪辑视频中的音视频多片段时序定位(AV-MSG)问题,可为单个查询定位任意数量的时间片段。
Source: arXiv · Computer Vision · arxiv.org