论文
LLM数据智能体的轨迹完整性:真实世界系统中可审计结构化推理的愿景
Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems
摘要
答案准确率是LLM数据智能体不充分的可靠性信号。在结构化数据任务中,一个基准正确的答案可能由无效轨迹产生。本文引入轨迹完整性(Trace Integrity),一种部署可靠性准则,用于评估答案背后记录的计算是否显式、可执行、模式有效、算子忠实、可重放、答案一致且可审计。我们识别出结构鸿沟(Structure Gap)是使轨迹完整性成为必要的部署失败模式:自然语言推理和自由格式理由不能可靠地刻画真实世界系统所需的算子级程序。我们用执行契约(execution contracts)将轨迹完整性操作化——这是一类结构化工件,将用户意图绑定到模式元素、算子计划、假设、可执行查询、验证状态和最终答案关联上。我们还引入CAIT率(正确答案/无效轨迹率),衡量仅凭答案的评估有多少次把计算上无支持的输出计为成功。在BIRD Mini-Dev上的实证演示中,Direct SQL、Operation Summary + SQL和Contract-First SQL分别取得20%、22%和24%的答案准确率,而它们的轨迹完整通过率分别为39%、43%和40%,CAIT率则居高不下,分别为55%、59.1%和45.8%,这表明答案准确率、轨迹有效性和静默失败风险是彼此独立的评估信号。因此,真实世界的LLM数据智能体不仅应按其输出是否与参考答案匹配来评估,还应按这些输出是否有可审计的计算支撑来评估。
