arXiv · Computation and Language· Fahmid Shahriar Iqbal, Ritam Dutt, Soumitra Das, Arnav Verma, Sagnik Ray Choudhury·· 16 小时前AI 评分31
大语言模型时间抽取任务多维泛化能力评测
Evaluating Multi-Dimensional Generalization of Large Language Models in Temporal Extraction Tasks
AI 导读
该研究系统评测多个模型族、架构与推理策略在时间与事件表达抽取任务中的四维泛化表现,发现基础任务表现强通常预示更好泛化,但在显著分布偏移下该关系减弱。归纳式 prompting 在领域偏移、对抗扰动、组合性和长度增加上表现最稳定,规模、架构及演绎与溯因 prompting 的收益不均衡且依赖维度,LLM 泛化无法由单一维度可靠预测。论文被 AACL-IJCNLP 2026 Findings 接收。
来源:arXiv · Computation and Language · arxiv.org