论文

错而有用:多智能体消息中超越答案正确性的轨迹价值

Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

模型评测评测方法与指标

摘要

多智能体推理系统常用一致性、置信度或自动化评分来决定哪些消息应影响最终答案。这类过滤假设一条可能正确的消息也值得保留。然而一个错误的答案可能包含有用的分解、约束或科学原理。我们用多样性假设商议(Diverse Hypothesis Deliberation,DHD)来检验这一区分,这是一个受控测量协议:缓存五条独立生成的消息,并在每条消息可用或隐藏的条件下重放同一个下游求解器(称为整合者)。重放比较衡量一条消息的轨迹价值:让该消息可用是有助于还是有害于后续推理。在五个数学与科学基准和两个开放可用的模型家族(gpt-oss-120b与gemma-4-31B-it)上,错误但有用的消息出现在每一个基准-模型组合中。在改变最终正确性的错误答案消息中,每个模型上都有超过四成的改变是有帮助的。受控重复表明,可重复的消息效应数量不太可能仅由重放波动造成(p=0.0002)。针对可重复的错误但有用消息的聚焦干预发现,完整消息效果最好,而保留其推理比只保留其答案能保留更多成功;完整消息优势的来源仍是开放问题。在同一问题内,重复的轨迹价值证据也比仅凭答案正确性更能识别出更好的保留或移除选择。因此,答案正确性有信息量但不决定轨迹价值。DHD测量了这一缺失属性,并产出可用于学习智能体何时该倾听的可复用标签。

错而有用:多智能体消息中超越答案正确性的轨迹价值:论文配图
图2:多样假说审议(Diverse Hypothesis Deliberation, DHD)协议。招募者在看不到真实答案的情况下指派五个针对具体问题的角色。每个假说提出者从其角色出发独立产出一条结构化消息,无法访问同伴消息或真实答案。整合者将缓存消息中选定的子集综合为一个最终答案,且不被告知哪些所提答案是正确的。评估者随后在不观察智能体推理的情况下,将整合者的答案与真实答案进行比较。