热点事件持续更新
CineSubBench:基于多语言电影字幕评估LLM的长叙事与文化理解
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026-09-30,研究者发布 CineSubBench 评测基准,基于多语言电影字幕评估大语言模型的长叙事与文化理解能力。该基准覆盖 1,012 部电影、6 种语言、6,072 条字幕轨道和 813 万条时间戳字幕条目,包含叙事重建与抽象、类型预测、年龄适宜性、10 国电影分级系统及字幕语言安全等 7 项任务。评测涉及 9 个 LLM,结果显示情节前提比完整梗概更易恢复,跨语言一致性差异显著,脏话比轻微粗俗更易定位。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 12:00
CineSubBench 基准发布,覆盖 1,012 部电影与 6 种语言,揭示 LLM 在长叙事与文化理解上的差异。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv · Computation and LanguageCineSubBench:基于多语言电影字幕评估大语言模型的长叙事与文化理解能力
CineSubBench 是一个基于多语言电影字幕的长上下文理解评测基准,覆盖 1,012 部电影、6 种语言、6,072 条字幕轨道和 813 万条时间戳字幕条目。基准包含 7 项任务,涵盖叙事重建与抽象、类型预测、年龄适宜性、10 国电影分级系统及字幕语言安全。评测显示,9 个 LLM 中情节前提比完整梗概更易恢复,跨语言一致性差异显著,脏话比轻微粗俗更易定位。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。