论文
TriEx:用于解释多智能体内部推理的基于游戏的三视图框架 LLM
TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs
摘要
大语言模型 (LLM) 智能体的可解释性在交互式、部分可观察的环境中尤其具有挑战性,其中决策取决于不断变化的信念和其他智能体。我们提出了 \textbf{TriEx},一个三视图可解释性框架,它通过对齐的工件来进行顺序决策:(i)与行动绑定的结构化第一人称自我推理,(ii)随着时间的推移更新关于对手的明确的第二人称信念状态,以及(iii)基于环境衍生参考信号的第三人称预言审计。这种设计将解释从自由形式的叙述转变为可以跨时间和视角进行比较和检查的证据锚定对象。使用不完美信息策略博弈作为受控测试平台,我们证明 TriEx 能够对解释 忠实性、信念动态和评估者可靠性进行可扩展分析,揭示Agent所说、所相信和所做之间的系统性不匹配。我们的结果强调了可解释性作为一种依赖于相互作用的属性,并激发了对 LLM 代理的多视图、基于证据的评估。代码可在 https://github.com/Einsam1819/TriEx 获取。