论文
错而有用:多智能体消息中超越答案正确性的轨迹价值
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages
摘要
多智能体推理系统常用一致性、置信度或自动化评分来决定哪些消息应影响最终答案。这类过滤假设一条可能正确的消息也值得保留。然而一个错误的答案可能包含有用的分解、约束或科学原理。我们用多样性假设商议(Diverse Hypothesis Deliberation,DHD)来检验这一区分,这是一个受控测量协议:缓存五条独立生成的消息,并在每条消息可用或隐藏的条件下重放同一个下游求解器(称为整合者)。重放比较衡量一条消息的轨迹价值:让该消息可用是有助于还是有害于后续推理。在五个数学与科学基准和两个开放可用的模型家族(gpt-oss-120b与gemma-4-31B-it)上,错误但有用的消息出现在每一个基准-模型组合中。在改变最终正确性的错误答案消息中,每个模型上都有超过四成的改变是有帮助的。受控重复表明,可重复的消息效应数量不太可能仅由重放波动造成(p=0.0002)。针对可重复的错误但有用消息的聚焦干预发现,完整消息效果最好,而保留其推理比只保留其答案能保留更多成功;完整消息优势的来源仍是开放问题。在同一问题内,重复的轨迹价值证据也比仅凭答案正确性更能识别出更好的保留或移除选择。因此,答案正确性有信息量但不决定轨迹价值。DHD测量了这一缺失属性,并产出可用于学习智能体何时该倾听的可复用标签。
