论文

多模型AI系统中的涌现式协作审议:一种源于BFT的认识论综合协议

Emergent Collaborative Deliberation in Multi-Model AI Systems: A BFT-Derived Protocol for Epistemic Synthesis

智能体系统Agent 协作

摘要

我们提出Consilium协议,一种源自拜占庭容错(BFT)的架构,用于结构化的多模型AI审议,它将模型间分歧视为认识论信号而非错误。该协议为语言模型指派经过设计的认知人格——将模型“是什么”与它“如何推理”分离开来——并引入一个改编自量化金融的样本内/样本外(In-Sample/Out-of-Sample)验证框架,以区分训练数据共识与有经验依据的结论。在覆盖10个领域类别、32个主题的1,478次审议会话中,我们证明:(1)决定认识行为的是认知人格而非底层模型:每批次成本0.0002美元的免费边缘推理模型,产生了与成本10.69美元的前沿模型相当的分析输出;(2)RLHF对齐训练造成可测量的、领域特定的认识盲区——有争议的政策类主题比已有定论的科学主题少12.3个百分点的对抗性质询,且AI安全主题表现出不对称偏差(Δ=11.6%):模型质疑“AI是危险的”这一论断的力度远强于质疑“AI风险被夸大了”的论断;(3)协议自身不表现出方向性偏差(移民议题Δ=2.3%,可再生能源议题Δ=1.2%);(4)样本外证据检索以100%的证据检索率验证了239项论断,并浮现出167项训练数据审议无法察觉的盲区发现。在随机化的模型×人格分配下,运行间可复现性平均为±2.2%的标准差。包含全部开销在内的完整测试套件总成本为217美元。我们以MIT许可证发布协议规范,以便进行独立验证。