LLM能预测失败风险,却难以预测哪种协作协议划算:跨推理任务的成本感知协议路由
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks
摘要
多智能体大语言模型(LLM)系统可以通过花费更多计算来提升推理能力,但部署时需要判断额外的协作何时值得其成本。我们在每个设置中固定求解器、让每个问题在四种协议下运行,以隔离这一决策:直接求解(Baseline)、迭代自我纠错(Single)、规划者-执行者-审查者协作(PER)和多智能体审议(Broadcast)。主基准包含4,181道竞赛级数学题;配对稳健性检查覆盖竞赛数学、生物学和更广泛科学的四个基准、两个求解器家族。在固定策略、训练路由器和冻结LLM路由器中,保守策略升级不足,而较高解出率的冻结路由器往往升级过度。一个答案后、协作前的gpt-oss-120b探针以0.8847 AUROC对Baseline失败进行排序(4,151个可解析案例;95% CI [0.8732, 0.8955])。同一分数对预测任意协作是否有帮助仍有信息量(0.7683 AUPRC),但对识别PER或Broadcast的特定价值则弱得多(AUPRC分别为0.1674和0.1041)。另外,答案前的自信门控在45K tokens下达到78.0%解出率,相比之下冻结gpt-oss-120b路由器在71.3K tokens下为73.8%,回顾式固定顺序神谕为92.4%。在10个配对模型-条件设置中,神谕比Baseline增加23.2-58.3个百分点的回顾式覆盖,但协议表现因任务而异。在有held-out路由器评估的六个设置中,神谕差距保持在18.5-28.9个百分点。因此,自信度可以支持初始升级决策,而协议特定的成本感知路由仍未解决。