arXiv · Computer Vision· Ziying Zhang, Litao Li, Junchao Liao, Tianyi Zeng, Siyu Zhu, Long Qin, Zhenghao Zhang·· 6 小时前AI 评分38
VidScribe:视频生成中视觉文本渲染与原地编辑的统一基准测试
Beyond Legibility: Benchmarking Visual Text Rendering and In-Place Editing in Unified Video Generation
AI 导读
VidScribe 是一个覆盖 T2V、R2V、I2V、V2V 四种生成模式的视频文本诊断基准,包含 803 个人工验证样本和 12 轴正交因子空间。评测 11 个商业与开源系统后发现,视频文本能力非单一,I2V 最稳定,V2V 编辑是主要瓶颈,且退化集中在文本结构与时序因素。基准对齐的偏好优化可带来可测量的视觉文本生成提升。
来源:arXiv · Computer Vision · arxiv.org