arXiv · Computer Vision· Jaedong Hwang, Xiaoqian Shen, Ernie Chang, Changsheng Zhao, Chong Zhou, Saksham Suri, Qi Qian, Zechun Liu, Lemeng Wu, Qinsi Wang, Raghuraman Krishnamoorthi, Wei Wen·· 3 小时前AI 评分52
研究用原始视频中训练 Qwen3-1.7B
Mid-Training Language Models on Raw Video
AI 导读
论文研究中训练 Qwen3-1.7B 使用无标注原始视频的可行性,把帧编码为连续视觉 token 并让模型预测下一个视觉 token。在 YT-Temporal-1B 原始片段上中训练后,四个视频基准平均高 2.9 分、十个图像基准平均高 5.1 分,14 个文本基准平均 48.9 对 48.0,文本表现保持。
来源:arXiv · Computer Vision · arxiv.org