跳到正文
原文
arXiv · Computer Vision· Peng Xie, Amr Alanwar·· 3 小时前AI 评分42

视频世界模型对隐藏物体保留了什么:追踪不等于永久存在

Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object

AI 导读

研究以冻结的 V-JEPA 2 预测器隐藏物体,比较其预测与编码器表征:静止物体仅部分保留,被容器携带的物体完全不保留,移动物体在 0.3 秒内丢失(V-JEPA 自身 tube mask 下 0.5 秒,ViT-H 在 90% 掩码率下保留至 1.1 秒)。

来源:arXiv · Computer Vision · arxiv.org