论文
Nautil结案时机基准
Not Until the Evidence Says So: Teaching LLM Investigators When to Close a Case
摘要
事故、缺陷与停机调查以一个普通问答从不面对的决定收尾:现有证据是否足以结案。我们为LLM调查者研究这一判断——它们从案卷请求证据、修正假设,然后要么基于所读内容给出结论结案,要么保持开放并指出缺失。这一判断不随能力而来:未训练的9B模型在97%的答案中夸大证据;一个在84%案例中找对原因的前沿模型仍然91%夸大,并在官方结论为"原因未定"的41个案例中结案17个。测量它也不平凡:案例来源在很大程度上预测标签,仅读来源的规则在我们测试案例上达到83.0平衡准确率。因此我们用三个测试评估结案:对照该规则与来源内报告的结案准确率;移除结论依据并检查模型是否停止结案的证据依赖性;以及结论与缺口质量的评判清单。我们构建Nautil:来自航空、铁路、海事、化学品安全、车辆缺陷报告与生产服务器事故的731个审计案例,附教师轨迹、分布外测试集与反事实证据版本。在教师轨迹上微调9B模型使其结案跟随证据:移除依据使其结案率相对匹配对照下降26点,夸大从97%降至35%,正确且未夸大的结论从3%升至43%。只奖励结案决策的强化学习再把平衡准确率从69.2提到83.3(与教师相当)、来源内准确率从60.4提到74.1,但牺牲部分证据依赖。