跳到正文
原文
arXiv · Computer Vision· Donghao Zhou, Haoyang He, Fan Zhang, Hao Yang, Guisheng Liu, Xin Gao, Zhongwei Wan, Xingyuan Bu, Jie Wang, Qiangpeng Yang, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng·· 3 小时前AI 评分42

ThinkV2V:激活 MLLM 推理能力以实现指令驱动的视频编辑

ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing

AI 导读

ThinkV2V 是一个面向复杂指令驱动视频编辑的推理驱动框架,通过 MLLM-to-DiT 架构将源视频与指令的显式思考转化为精细的条件信号。框架结合渐进课程训练与推理时思考缩放,并配套 ThinkV2V-150K 数据集和 ThinkV2V-Bench。其 5B 规模 DiT 模型在复杂与标准编辑场景上均达到 SOTA,明显超越 10B 基线。

来源:arXiv · Computer Vision · arxiv.org