跳到正文
热点事件持续更新

研究用原始视频训练Qwen3-1.7B

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月9日,arXiv计算机视觉方向发布一手论文,研究在原始视频中训练Qwen3-1.7B的可行性。研究将视频帧编码为连续视觉token,让模型预测下一个视觉token,并在YT-Temporal-1B原始片段上完成训练。结果显示,四个视频基准平均提高2.9分,十个图像基准平均提高5.1分;14个文本基准得分为48.9对48.0,文本表现保持。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv · Computer Vision
    研究用原始视频中训练 Qwen3-1.7B

    论文研究中训练 Qwen3-1.7B 使用无标注原始视频的可行性,把帧编码为连续视觉 token 并让模型预测下一个视觉 token。在 YT-Temporal-1B 原始片段上中训练后,四个视频基准平均高 2.9 分、十个图像基准平均高 5.1 分,14 个文本基准平均 48.9 对 48.0,文本表现保持。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。