跳到正文
原文
arXiv · Computer Vision· Mikhail Dereviannykh, Vikram Voleti, Simon Donne, Mallikarjun Byrasandra Ramalinga Reddy, Shimon Vainer, Mark Boss·· 3 小时前AI 评分36

SemanTok:可预测语义 Token 的高效自回归视频生成

SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

AI 导读

SemanTok 是一种灵活视频 tokenizer,将冻结 DINO 特征注入编码器,并通过轻量头从每个保留 token 前缀重建。201M 参数的 SemanTok AR 模型匹配或超越 3.4 倍规模的 VideoFlexTok AR 模型,在各类 AR 尺寸下均保持语义对齐与视频保真度。短 token 前缀预测成本更低、生成保真度更高,像素细节延后到后续 token。

来源:arXiv · Computer Vision · arxiv.org