论文
面向电网诊断的多模态LLM任务条件忠实性审计
Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis
摘要
多模态大语言模型(LLM)能够结合拓扑结构、量测数据和事件文本进行电网诊断,但答案正确并不能证明其使用了符合任务要求的证据。本短文提出一个用于开展任务条件忠实性审计的通用框架。该框架比较自我报告的依赖、通过干预导出的行为依赖,以及预先登记的工程重要性。框架首先登记任务特定的证据要求,并将其与受控模态消融下的自我报告依赖和行为变化进行比较。为解决检测到的不一致,我们设计了一种证据门控的纠正与再审计机制,在证据约束下重新生成失败的响应,并对其进行独立再消融,以验证依据性得到改善且性能没有损失。案例研究在IEEE 39节点和118节点场景上评估了三个不同规模的LLM。这些结果验证了该框架检测、诊断和纠正任务条件忠实性失败的能力。