论文

LLM即调查员:面向稳健交互式问题诊断的证据优先推理

LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

智能体系统Agent 架构与控制循环

摘要

大型语言模型 (LLM) 越来越多地用作解决技术问题的交互式助手。然而,当用户提供不完整的描述或看似合理但未经验证的解释时,大语言模型可能会过早地与这些假设保持一致,并在收集足够的证据之前提出解决方案。我们将这种行为称为用户驱动的阿谀奉承:大语言模型倾向于强化用户提供的假设,而不是测试其他解释。本文介绍了大语言模型作为研究者,这是一种用于稳健问题诊断的证据优先智能体AI方法。该方法是通过解决方案调查器代理来实现的,该代理会估计初始问题描述的模糊性,生成候选假设,提出有针对性的澄清问题,并在每个答案后更新假设概率。该智能体不会立即做出回应,而是继续调查,直到证据表明一种候选解释比其他解释更有说服力。为了评估该方法,我们根据机械、电气和液压领域已解决的技术论坛主题建立了基准。我们使用三代理评估管道,其中问题解决方案提取器代理将已解决的线程转换为结构化案例,地面真相评估器代理在隐藏已知解决方案的同时模拟用户,而受测试的助手则尝试通过对话恢复解决方案。这些实验比较了标准助理、面向推理的大语言模型以及跨大语言模型骨干的基于研究者的模型。除了诊断准确性之外,我们还分析标准助手如何在诊断案例中遵循误导性的用户假设。结果表明,所提出的方法比直接提示和仅推理基线更准确地识别问题,而其证据优先协议有助于减少用户引起的对话偏见。