arXiv · Computation and Language· Mir Tafseer Nayeem, Susmoy Chakraborty, Davood Rafiei·· 6 小时前AI 评分28
CineSubBench:基于多语言电影字幕评估大语言模型的长叙事与文化理解能力
CineSubBench: Evaluating LLMs on Long-Form Narrative and Cultural Understanding from Multilingual Movie Subtitles
AI 导读
CineSubBench 是一个基于多语言电影字幕的长上下文理解评测基准,覆盖 1,012 部电影、6 种语言、6,072 条字幕轨道和 813 万条时间戳字幕条目。基准包含 7 项任务,涵盖叙事重建与抽象、类型预测、年龄适宜性、10 国电影分级系统及字幕语言安全。评测显示,9 个 LLM 中情节前提比完整梗概更易恢复,跨语言一致性差异显著,脏话比轻微粗俗更易定位。
来源:arXiv · Computation and Language · arxiv.org