热点事件持续更新
VidHarness与ThinkV2V:视频理解与编辑框架并行推进
2 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026-10-01同日发布两项视频AI框架。VidHarness通过蒙特卡洛树搜索自动进化视频智能体,结合不确定性感知的多保真度验证降低评估成本,在LongVideoBench、Video-MME和Video-Holmes上达到新SOTA,比最强手工智能体高11.2分。ThinkV2V面向复杂指令驱动视频编辑,采用MLLM-to-DiT架构将源视频与指令的显式思考转化为精细条件信号,配套ThinkV2V-150K数据集和ThinkV2V-Bench,其5B规模DiT模型在复杂与标准编辑场景上均达SOTA,明显超越10B基线。两项研究均为一手arXiv发布。
AI 根据报道生成 · 1 小时前更新
事件进展
2 个进展
- 10月1日 12:00 · 1 篇报道ThinkV2V:激活 MLLM 推理能力以实现指令驱动的视频编辑arXiv · Computer Vision:ThinkV2V:激活 MLLM 推理能力以实现指令驱动的视频编辑
- 10月1日 12:00 · 1 篇报道VidHarness: 自动化视频智能体框架提升长视频理解效率arXiv · Computer Vision:VidHarness:面向低成本长视频理解的智能体框架进化
报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv · Computer VisionThinkV2V:激活 MLLM 推理能力以实现指令驱动的视频编辑
ThinkV2V 是一个面向复杂指令驱动视频编辑的推理驱动框架,通过 MLLM-to-DiT 架构将源视频与指令的显式思考转化为精细的条件信号。框架结合渐进课程训练与推理时思考缩放,并配套 ThinkV2V-150K 数据集和 ThinkV2V-Bench。其 5B 规模 DiT 模型在复杂与标准编辑场景上均达到 SOTA,明显超越 10B 基线。
- arXiv · Computer VisionVidHarness:面向低成本长视频理解的智能体框架进化
VidHarness通过蒙特卡洛树搜索自动进化视频智能体,结合不确定性感知的多保真度验证降低评估成本,并在LongVideoBench、Video-MME和Video-Holmes上达到新SOTA,比最强手工智能体高11.2分。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。