热点事件持续更新
研究LLM在无正确选项MCQA中的弃答可靠性
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
研究者提出罚金式无正确选项 MCQA 设定:在 MMLU-Pro 数学子集中移除标注的正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对被迫作答的无效响应施加惩罚。研究进一步引入正确条件分析,仅在模型原本答对的样本上评估弃权表现。结果显示,高 MCQA 准确率并不能保证弃权可靠性;即使在明确提示无正确选项并采用罚金评分时,模型仍会对部分原本答对的样本给出无效强制选择。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
新研究用罚金式设定与正确条件分析,显示高准确率不等于可靠弃答。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Computation and Language罚金式无正确选项 MCQA:分析 LLM 在选项全部无效时的弃权行为
研究者提出罚金式无正确选项 MCQA 设定,在 MMLU-Pro 数学子集中移除标注的正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对被迫作答的无效响应施加惩罚。研究进一步引入正确条件分析,仅在模型原本答对的样本上评估弃权表现。结果显示,高 MCQA 准确率并不能保证弃权可靠性,即使在明确提示无正确选项并采用罚金评分时,模型仍会对部分原本答对的样本给出无效强制选择。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。