跳到正文
热点事件持续更新

LLM时间表达抽取多维泛化能力评测

1 篇报道1 个报道来源16 小时前 更新

先了解这件事

AI 综述

该研究系统评测多个模型族、架构与推理策略在时间与事件表达抽取任务中的四维泛化表现。结果显示,基础任务表现强通常预示更好泛化,但在显著分布偏移下该关系减弱。归纳式 prompting 在领域偏移、对抗扰动、组合性和长度增加上表现最稳定;规模、架构及演绎与溯因 prompting 的收益不均衡且依赖维度,LLM 泛化无法由单一维度可靠预测。论文被 AACL-IJCNLP 2026 Findings 接收。

AI 根据报道生成 · 16 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv · Computation and Language
    大语言模型时间抽取任务多维泛化能力评测

    该研究系统评测多个模型族、架构与推理策略在时间与事件表达抽取任务中的四维泛化表现,发现基础任务表现强通常预示更好泛化,但在显著分布偏移下该关系减弱。归纳式 prompting 在领域偏移、对抗扰动、组合性和长度增加上表现最稳定,规模、架构及演绎与溯因 prompting 的收益不均衡且依赖维度,LLM 泛化无法由单一维度可靠预测。论文被 AACL-IJCNLP 2026 Findings 接收。

本事件热度走势

当前热度 7·可比范围峰值 10(10月5日 13:00)·近 24 小时可比范围变化 –

02.557.51010月5日13:0010月5日18:0010月5日22:0010月6日03:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。