跳到正文
热点事件持续更新

VidHarness与ThinkV2V:视频理解与编辑框架并行推进

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-01同日发布两项视频AI框架。VidHarness通过蒙特卡洛树搜索自动进化视频智能体,结合不确定性感知的多保真度验证降低评估成本,在LongVideoBench、Video-MME和Video-Holmes上达到新SOTA,比最强手工智能体高11.2分。ThinkV2V面向复杂指令驱动视频编辑,采用MLLM-to-DiT架构将源视频与指令的显式思考转化为精细条件信号,配套ThinkV2V-150K数据集和ThinkV2V-Bench,其5B规模DiT模型在复杂与标准编辑场景上均达SOTA,明显超越10B基线。两项研究均为一手arXiv发布。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月1日 12:00 · 1 篇报道
    ThinkV2V:激活 MLLM 推理能力以实现指令驱动的视频编辑
    arXiv · Computer Vision:ThinkV2V:激活 MLLM 推理能力以实现指令驱动的视频编辑
  2. 10月1日 12:00 · 1 篇报道
    VidHarness: 自动化视频智能体框架提升长视频理解效率
    arXiv · Computer Vision:VidHarness:面向低成本长视频理解的智能体框架进化

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Computer Vision
    ThinkV2V:激活 MLLM 推理能力以实现指令驱动的视频编辑

    ThinkV2V 是一个面向复杂指令驱动视频编辑的推理驱动框架,通过 MLLM-to-DiT 架构将源视频与指令的显式思考转化为精细的条件信号。框架结合渐进课程训练与推理时思考缩放,并配套 ThinkV2V-150K 数据集和 ThinkV2V-Bench。其 5B 规模 DiT 模型在复杂与标准编辑场景上均达到 SOTA,明显超越 10B 基线。

  2. arXiv · Computer Vision
    VidHarness:面向低成本长视频理解的智能体框架进化

    VidHarness通过蒙特卡洛树搜索自动进化视频智能体,结合不确定性感知的多保真度验证降低评估成本,并在LongVideoBench、Video-MME和Video-Holmes上达到新SOTA,比最强手工智能体高11.2分。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。