论文

从辩论到决策:面向安全多智能体商议的共形社会选择

From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation

智能体系统Agent 动作执行与治理

摘要

多智能体辩论能改进LLM推理,但智能体之间达成一致并非正确性的证据。当智能体经由社会性强化在错误答案上收敛时,基于共识的停止机制会把该错误提交为自动行动且无从补救。我们提出Conformal Social Choice,一个事后决策层,将辩论输出转化为经校准的行动-升级决策。来自异构智能体的言语化概率分布经线性意见池聚合,并用split conformal prediction校准,得到具有边际覆盖率保证的预测集合:正确答案以${\geq}\,1{-}α$的概率被包含在内,且无需对单个模型的校准性做任何假设。分层行动策略将单元素集合映射为自主行动,将更大的集合映射为人工升级。在八个MMLU-Pro领域、三个智能体(Claude Haiku、DeepSeek-R1、Qwen-3 32B)的设置下,覆盖率与目标的偏差保持在1至2个百分点以内。关键发现不在于辩论变得更准确,而在于共形层使其失败变得可处置:在$α{=}0.05$时,81.9%的错误共识案例被拦截。由于该层拒绝在辩论自信却错误的案例上行动,剩余的共形单元素集合达到90.0--96.8%的准确率(比共识停止最高高出22.1个百分点)——这是一种选择效应,而非推理改进。这种安全以牺牲自动化为代价,但工作点可通过$α$由用户调节。

从辩论到决策:面向安全多智能体商议的共形社会选择:论文配图
图 1:没有校准拒绝的行动成本。共识停止永远不会升级(升级率为 0%),但会导致高错误率(高达 32.1%)。保形停止以自动化换取安全:通过将不确定的案例升级为人工审查,它大大减少了所处理案例中的错误。在 α=0.05\alpha{=}0.05 时,81.9% 的错误共识案例会升级而不是采取行动。每个箭头在两个停止规则下连接相同的域。