Skip to content
Hot eventLive

VLM视频标注启发式方法的成本与有效性系统评估

2 reports1 sources3 hr ago updated

Get the story

AI overview

2026-10-02,arXiv发表两项计算机视觉相关研究。第一项系统评估VLM视频标注的降本启发式方法,发现短时视频采用单张2×8图像网格配合镜头切换检测,可达全视频理解水平(κ差异在.05内),token成本仅约15%,并提出面向计算社会科学任务的成本感知标注指南;同时指出最高准确率配置可能产生错误结论,文本单独使用即可取得强性能。第二项提出基于VLMs的AR内容自动评估与优化框架RateAR,覆盖多场景AR图像与视频基准,评测11个商用VLM后预测与人类主观判断Spearman相关系数最高达0.8695,21人用户研究显示超90%参与者认为系统改善了虚拟内容的放置与尺寸一致性。

Generated from reports · updated 2 hr ago

Developments

2 developments
  1. Oct 2 · 1 reports
    VLM驱动AR内容质量评估与自动调整框架RateAR
    arXiv · Computer Vision: 利用视觉-语言模型进行AR感知质量评估与自主内容调整
  2. Oct 2 · 1 reports
    VLM视频标注启发式方法的成本与有效性系统评估
    arXiv · Computer Vision: 视觉语言模型视频标注中的成本与有效性:简单启发式方法的系统评估

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Computer Vision
    视觉语言模型视频标注中的成本与有效性:简单启发式方法的系统评估

    研究系统评估了VLM视频标注中的降本启发式方法,发现最高准确率配置可能产生错误结论,且文本单独使用即可取得强性能。短时视频采用单张2×8图像网格配合镜头切换检测,可达全视频理解水平(κ差异在.05内),token成本仅约15%。基于此提出面向计算社会科学任务的成本感知VLM标注指南。

  2. arXiv · Computer Vision
    利用视觉-语言模型进行AR感知质量评估与自主内容调整

    研究提出基于视觉-语言模型(VLMs)的AR内容自动评估与优化框架RateAR,涵盖多场景AR图像与视频基准。评测11个商用VLM后,预测结果与人类主观判断Spearman相关系数最高达0.8695;上下文提示策略在复杂度与对齐度之间表现更优。21人用户研究显示超90%参与者认为系统改善了虚拟内容的放置与尺寸一致性。

Heat trend

There is not enough continuous observation data to draw a trend yet.