跳到正文
原文
arXiv · Computer Vision· Zhixi Zhu, Kristina Gligoric·· 3 小时前AI 评分38

视觉语言模型视频标注中的成本与有效性:简单启发式方法的系统评估

Paying for Too Many Tokens? Valid and Cost-Efficient Multimodal LLM Annotation with Simple Heuristics

AI 导读

研究系统评估了VLM视频标注中的降本启发式方法,发现最高准确率配置可能产生错误结论,且文本单独使用即可取得强性能。短时视频采用单张2×8图像网格配合镜头切换检测,可达全视频理解水平(κ差异在.05内),token成本仅约15%。基于此提出面向计算社会科学任务的成本感知VLM标注指南。

来源:arXiv · Computer Vision · arxiv.org