Hot eventLive
SemanTok:面向自回归视频生成的可预测语义Token
1 reports1 sources3 hr ago updated
Get the story
AI overview
SemanTok 是一种面向自回归视频生成的灵活视频 tokenizer,将冻结 DINO 特征注入编码器,并通过轻量头从每个保留 token 前缀重建。201M 参数的 SemanTok AR 模型匹配或超越 3.4 倍规模的 VideoFlexTok AR 模型,在各类 AR 尺寸下均保持语义对齐与视频保真度。短 token 前缀预测成本更低、生成保真度更高,像素细节延后到后续 token。
Generated from reports · updated 2 hr ago
Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · Computer VisionSemanTok:可预测语义 Token 的高效自回归视频生成
SemanTok 是一种灵活视频 tokenizer,将冻结 DINO 特征注入编码器,并通过轻量头从每个保留 token 前缀重建。201M 参数的 SemanTok AR 模型匹配或超越 3.4 倍规模的 VideoFlexTok AR 模型,在各类 AR 尺寸下均保持语义对齐与视频保真度。短 token 前缀预测成本更低、生成保真度更高,像素细节延后到后续 token。
Heat trend
There is not enough continuous observation data to draw a trend yet.