跳到正文
热点事件持续更新

研究LLM在无正确选项MCQA中的弃答可靠性

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

研究者提出罚金式无正确选项 MCQA 设定:在 MMLU-Pro 数学子集中移除标注的正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对被迫作答的无效响应施加惩罚。研究进一步引入正确条件分析,仅在模型原本答对的样本上评估弃权表现。结果显示,高 MCQA 准确率并不能保证弃权可靠性;即使在明确提示无正确选项并采用罚金评分时,模型仍会对部分原本答对的样本给出无效强制选择。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Computation and Language
    罚金式无正确选项 MCQA:分析 LLM 在选项全部无效时的弃权行为

    研究者提出罚金式无正确选项 MCQA 设定,在 MMLU-Pro 数学子集中移除标注的正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对被迫作答的无效响应施加惩罚。研究进一步引入正确条件分析,仅在模型原本答对的样本上评估弃权表现。结果显示,高 MCQA 准确率并不能保证弃权可靠性,即使在明确提示无正确选项并采用罚金评分时,模型仍会对部分原本答对的样本给出无效强制选择。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。