arXiv · Computation and Language· Tingzhu Bi, Ping Wang, Meng Ma·· 16 小时前AI 评分56
LLM 调查员何时结案:基于证据的关闭决策研究
Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
AI 导读
论文研究 LLM 调查员在事故、缺陷和宕机调查中何时应结案,提出结案准确性、证据依赖性和结论与缺口质量三项评测,并构建含 731 份审计案例的 Nautil 数据集。微调 9B 模型后,过度断言从 97% 降至 35%,正确且不夸大的结论从 3% 升至 43%;仅奖励结案决策的强化学习将平衡准确率从 69.2 提升到 83.3。
来源:arXiv · Computation and Language · arxiv.org