论文

学习何时不应决策:克服AI裁决中事实性臆断的框架

Learning When Not to Decide: A Framework for Overcoming Factual Presumptuousness in AI Adjudication

模型推理推理策略与问题分解

摘要

AI系统的一个众所周知的局限是臆断:在信息可能不足时仍给出自信答案的倾向。这一挑战在法律应用中尤为尖锐,因为律师、法官和行政人员的核心任务之一就是判断证据是否足以得出结论。我们在失业保险裁决这一重要场景中研究该问题,该领域AI系统集成迅速,而是否需要额外的事实调查是这一影响每年数百万申请人的系统中最显著的瓶颈。首先,通过与科罗拉多州劳动与就业部的合作,我们罕见地获得了官方训练材料与指南,以设计一个在信息完整性上系统性变化的新颖基准。其次,我们评估了四个领先的AI平台,结果表明当信息不足时,标准的基于RAG的方法平均只有15%的准确率。第三,先进的提示方法提高了非结论性案件的准确率,但存在过度矫正,连明确案件也不作决策。第四,我们提出一个结构化框架,要求在任何裁决之前显式识别缺失信息(SPEC,Structured Prompting for Evidence Checklists)。SPEC实现了89%的总体准确率,同时在证据不足时适当地延后决策——这表明法律AI中的臆断是系统性的但可以应对的,并且在那些必须等待充分证据的决策场景中,这样做是迈向可靠支持而非取代人类判断的系统的必要一步。

学习何时不应决策:克服AI裁决中事实性臆断的框架:论文配图
图 3.SPEC 管道。 RAG 系统提取法律规定、判例法和注意事项作为完整的段落。动态提示指导三个代理:代理 1 构建需求清单,代理 2 根据需求验证事实,代理 3 提供有权推翻评估的监督审查。如果不存在关键差距,则做出决定;否则,建议进行具体事实调查。