论文

审计成对等价判断:多智能体假设生成中的自批评与多样性测量

Auditing Pairwise Equivalence Judgments: Self-Critique Effects and Diversity Measurement in Multi-Agent Hypothesis Generation

模型评测评测方法与指标

摘要

基于 大语言模型 (LLM) 构建的多智能体系统越来越多地应用于科学发现和假设生成。在实验基础事实存在之前,细化的效果和交付集的多样性都很难解释,并且通常通过确定生成的假设对是否描述相同的潜在机制来报告两者。我们研究了基于这种成对等价判断的两个评估问题:(1)自我批评改变了多少超出运行间变异性的假设,以及(2)用于分组假设的等价规则如何影响测量的多样性。在四个专有实例中,我们固定开放假设,通过 0、1 和 5 轮批评重新运行下游工作流程,并使用 LLM 作为法官对匹配的假设对进行评分。相对于匹配的相同深度重播,从 0 轮移动到 1 轮会产生 34.5 个百分点 (pp) 的额外机制级别分歧,而 1 轮到 5 轮则增加 1.3 个百分点。然后,我们比较三个等价规则:术语频率-逆文档频率 (TF--IDF) 相似性、密集嵌入和相同的 LLM-as-a-judge。我们构建受控假设对,这些假设对要么通过措辞或生物术语的变化保留因果解释,要么替换因果链的一个组成部分,同时保持其余部分不变。所有三个规则对于保留意义的编辑都是不变的,但是当替换起始事件时,LLM 作为法官将 83% 的有效对识别为不同的机制,而 TF-IDF 为 0%,嵌入为 8%;仅改变定义相同机制的标题即可将该数字从 38% 提高到 96%。总之,这些结果表明,成对等价判断是一种测量选择:如何定义机制等价会影响自我批评的估计效果和所生成假设的测量多样性。

审计成对等价判断:多智能体假设生成中的自批评与多样性测量的原论文方法或结果图
图 1:本研究中使用的用于生成机械假设的 Multi-智能体工作流程。一项意想不到的实验发现启动了证据检索。候选假设是通过提案者和批评者智能体之间的自我批评循环并行生成和迭代完善的。由此产生的假设将被合并到最终报告中。