跳到正文
原文
arXiv · Computation and Language· Nishanth Nayakanti, Prasang Gupta, Ashutosh Bilthare, Kevin Paul·· 3 小时前AI 评分38

仅有结论而无标注证据:拒绝采样还是仅标签后训练用于证据恢复?

Verdicts Without Annotated Evidence: Rejection Sampling or Label-Only Post-Training for Evidence Recovery?

AI 导读

研究在 ContractNLI 上衡量小语言模型仅凭结论后训练时能恢复多少证据,人类证据片段直到评估才放出。匹配结论与吻合证据片段并不等同:六个系统中两项分数仅弱相关且排序不同,accuracy 不足以指导需可审查引用的场景。

来源:arXiv · Computation and Language · arxiv.org