热点事件持续更新
不可答与欠明确信号的跨域与多轮泛化研究
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
该研究以“Knowing When Not to Answer”为题,探讨大语言模型在欠规范输入下识别不可回答性的跨域与多轮泛化能力。研究使用 423 段对话、1,661 个标注轮次状态及模拟用户评测框架,在六个数据集与六个开源权重 LLM 上测试不可回答性探针。结果显示,探针在共享同一不可回答基础的数学数据集(AUROC 0.77–0.97)与段落数据集(SQuAD 2.0、MuSiQue,0.77–0.90)之间稳健迁移;但单轮探针在零样本条件下无法检测对话何时变得可回答,表明跨域迁移有效而多轮状态识别仍受限。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
新报道披露该研究在六数据集六开源 LLM 上验证探针跨域迁移有效,但单轮零样本无法识别对话变可回答。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Computation and LanguageKnowing When Not to Answer:潜在欠规范信号的跨域与多轮泛化研究
研究用 423 段对话、1,661 个标注轮次状态和模拟用户评测框架,在六个数据集与六个开源权重 LLM 上测试不可回答性探针。探针在共享同一不可回答基础的数学(AUROC 0.77-0.97)与段落(SQuAD 2.0、MuSiQue,0.77-0.90)数据集间稳健迁移,但单轮探针零样本无法检测对话何时变得可回答。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。