论文

必要还是充分?用行为证据检验LLM解释

Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence

模型评测评测方法与指标

摘要

可以在智能体工作流程中运行的 LLM 决策组件通常会生成与操作相关的建议或判断以及解释。操作员可以使用指定的因素来监控系统、诊断错误或决定何时升级输出。这种使用假设解释与组件的可观察决策行为一致。我们测试了对命名因素的两种解释:必要性,意味着改变一个因素会改变输出;充分性,意味着保留它,同时删除其他可改变的信息将保留输出。我们在两个综合用例中评估这些解释:向客户推荐顾问以及判断有害或风险的提示。模型返回输出以及对其影响最大的三个因素。受控黑盒干预通过测量改变每个因素改变输出的频率来估计每个因素的必要性分数,并通过测量保留它保留输出的频率来估计充分性分数。在 Claude、GPT 和 Gemini 系列的八个模型中,引用的排名与必要性和充分性分数之间的平均 Spearman 相关性对于顾问推荐为 0.349 和 0.354,对于即时监控为 0.431 和 0.580。此外,在必要性的顾问回复中,57.6% 的未引用因素得分高于引用的最低得分因素,在充分性的顾问回复中,未引用因素的得分高于 58.1%;相应的及时监测率为25.8%和8.9%。引用的前三个因素包含有用的信息,但不能可靠地识别在必要性或充分性下具有最强测量影响的三个因素。该框架为智能体监督中使用的解释提供了黑盒可靠性检查,同时保留了个人大语言模型决策的范围。

必要还是充分?用行为证据检验LLM解释:论文配图
图 1:在顾问推荐中,引用频率与特征级别的必要性和充分性密切相关,但在即时监控中这种关系较弱。仅当风险功能处于活动状态时才计算提示监控引用频率。