arXiv · Computer Vision· Weihang Guo, Xiaoyu Wu, Yifei Wang, Niloofar Mireshghallah, Lydia E. Kavraki·· 6 小时前AI 评分39
视频生成推理的扩展代价:Scaling Video Generation for Reasoning 研究
Scaling Video Generation for Reasoning: At What Cost?
AI 导读
研究通过2x2x2魔方预测任务评估视频生成模型的推理能力与计算成本。70M参数模型在0.1 PF-days训练后可见贴纸配置准确率达44.6%,1B模型需3.14 PF-days达83.7%。符号状态监督使20M模型在相同数据预算下帧准确率从31.1%提升至67.3%,表明学习状态变化表征可补充扩展。
来源:arXiv · Computer Vision · arxiv.org