arXiv · Information Retrieval· Junjie Chen, Yuxi Dong, Haitao Li, Yiqun Liu, Qingyao Ai·· 3 小时前AI 评分18
NTCIR-19 AEOLLM-2 任务概览:LLM 长文本自动评测
Overview of the NTCIR-19 Automatic Evaluation of LLMs 2 (AEOLLM-2) Task
AI 导读
NTCIR-19 AEOLLM-2 任务在 NTCIR-18 AEOLLM 基础上进一步研究 LLM 自动评测方法,重点面向长文本生成场景。任务新增 Deep Research Evaluation 子任务,聚焦 LLM 生成的长篇深度研究报告的自动评测,参赛方所提方法的得分与人工标注 ground-truth 标签对比衡量。
来源:arXiv · Information Retrieval · arxiv.org