热点事件持续更新
ArcticQA/ArcticAbstain:北极科学LLM拒答数据集与基准
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月8日,研究者在arXiv(Computation and Language)发布 ArcticQA 数据集与 ArcticAbstain 基准,用于评测大语言模型在北极科学多选题中无有效选项时的拒答能力。数据集含194道题,基准对比答案存在与答案缺失两种条件,评测 Gemini、Claude、ChatGPT 系列共8个模型,记录9,312条回答。结果显示:答案存在时拒答率为0.0%至63.0%;将正确答案替换后,拒答率平均上升5.05个百分点。目前未见与此前报道相矛盾的信息。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
2026-10-08发布ArcticQA与ArcticAbstain,评测8个模型共9,312条回答。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · Computation and LanguageArcticQA:面向北极科学 LLM 拒答能力的数据集与基准
研究者发布 ArcticQA 数据集与 ArcticAbstain 基准,用于评测 LLM 在北极科学多选题中无有效选项时的拒答能力。数据集含 194 道题,基准对比答案存在与答案缺失两种条件,评测 Gemini、Claude、ChatGPT 系列共 8 个模型,记录 9,312 条回答。答案存在时拒答率为 0.0% 至 63.0%,替换正确答案后拒答率平均上升 5.05 个百分点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。