论文
ContractEval:程序指令一致性的查询条件执行匹配
ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance
摘要
当 LLM 智能体从回答问题转向执行程序时,失败可能是毫无根据的,而不是明显错误:即使系统跳过了使答案合理的检查、分支、依赖项或不变量,最终的响应看起来还是可以接受的。仅输出评估会看到答案,跟踪感知判断会看到活动,但两者都无法识别哪些义务对于查询是活动的。我们引入 CONTRACTEVAL,这是一个诊断框架,用于明确这些主动义务。它将程序指令表示为查询主动义务,并将它们与响应或跟踪证据进行匹配,将遗漏、错误分支、排序错误、额外操作、不变违规和输出契约违规转化为明显的一致性故障。在一套受控的经过审计的程序合同中,仅输出和跟踪感知的大语言模型法官错过了许多注入的结构性故障;在标准预期和观察图表下,ContractEval 检测并定位所有这些图表。 LLM 支持的提取保留了大部分信号,但仍然对校准敏感。因此,ContractEval 并不是合规保证;它使程序一致性可审计,而不是隐含在最终答案的质量中。