论文

一个可检查的 LLM 多模型研究答案聚合委员会

An Inspectable LLM Council for Multi-Model Research Answer Aggregation

智能体系统Agent 协作

摘要

长篇研究问题通常需要一个单一答案,该答案结合了细节、协调相互冲突的估计,并保留分布在多个 大语言模型 (LLM) 输出中的资格。我们提出了一个可检查的 LLM 委员会,它将综合分为两个阶段:分析师将三个独立的候选答案转换为结构化状态,而作者则根据该状态撰写最终响应。我们评估了闭卷条件下深度研究准确性、完整性和客观性 (DRACO) 基准的 100 项任务的工作流程,在主实验和补充实验中保留了 600 个最终答案、100 个分析师状态和 720 个完整答案判断。在主要评委的评分下,Council 得分为 70.98,比 GPT 和 Gemini 高出 6.18 分和 8.34 分;它与 Claude 的 0.47 点差异有 95% 的配对区间为 $[-0.69,1.61]$。在完整的补充比较中,理事会的得分比直接融合高出 1.87 分(95% 配对区间 $[0.33,3.48]$),并且涵盖了仅由一名候选人涵盖的积极评分标准的 51.1%,而直接融合为 43.7%。在具有匹配返回模型标签的探索性 68 任务子集中,直接融合得分更高,因此完整比较无法隔离分析师状态的影响。跟踪的案例显示了估计、出处资格和选择决策如何通过保存的状态传递到最终答案。