跳到正文
热点事件持续更新

CineSubBench:基于多语言电影字幕评估LLM的长叙事与文化理解

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,研究者发布 CineSubBench 评测基准,基于多语言电影字幕评估大语言模型的长叙事与文化理解能力。该基准覆盖 1,012 部电影、6 种语言、6,072 条字幕轨道和 813 万条时间戳字幕条目,包含叙事重建与抽象、类型预测、年龄适宜性、10 国电影分级系统及字幕语言安全等 7 项任务。评测涉及 9 个 LLM,结果显示情节前提比完整梗概更易恢复,跨语言一致性差异显著,脏话比轻微粗俗更易定位。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Computation and Language
    CineSubBench:基于多语言电影字幕评估大语言模型的长叙事与文化理解能力

    CineSubBench 是一个基于多语言电影字幕的长上下文理解评测基准,覆盖 1,012 部电影、6 种语言、6,072 条字幕轨道和 813 万条时间戳字幕条目。基准包含 7 项任务,涵盖叙事重建与抽象、类型预测、年龄适宜性、10 国电影分级系统及字幕语言安全。评测显示,9 个 LLM 中情节前提比完整梗概更易恢复,跨语言一致性差异显著,脏话比轻微粗俗更易定位。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。