论文

准确但不谦虚:评估知识冲突下LLMAgent的认知谦逊

Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict

智能体系统模型评测Agent任务评测鲁棒性、公平性与可信度评测

摘要

当检索到的证据与Agent先前的信念相矛盾时,它是否会修改答案、承认不确定性或坚持错误的结论?现有的 agentic 系统评估主要侧重于任务成功,对代理如何处理此类冲突提供的了解有限。我们建议评估智能体的认知谦逊(EH):智能体在任务执行过程中承认、采取行动和传达不确定性的意愿。我们通过三个轨迹级行为维度来实施 EH:识别、解决和升级 (ISE)。通过知识冲突,在主干语言模型的参数知识与它遇到的证据相矛盾的情况下,或者在两个上下文源不一致的情况下,我们评估两种冲突设置:(1)受控冲突和(2)多步agentic执行期间自然发生的冲突,每个冲突都与匹配的无冲突控制配对。评估四个智能体,我们发现更高的任务准确性并不一定对应于更大的认知谦逊:一些高精度配置 认识到执行过程中的冲突,但不会在错误的最终答案中传达未解决的不确定性。轨迹级分析进一步表明,代理经常在执行的早期步骤中检测到冲突,但无法在后续步骤中维护或解决它们。最后,我们表明模型级干预可以改善 EH,但通常以任务准确性为代价,这表明认知谦逊是从骨干模型、代理工具和评估环境之间的相互作用中产生的。