论文
跨AI架构的对话式推理:测试AI对齐策略的多模型框架
Dialogical Reasoning Across AI Architectures: A Multi-Model Framework for Testing AI Alignment Strategies
摘要
本文引入一个通过结构化多模型对话实证检验AI对齐策略的方法论框架。借鉴和平研究传统——特别是基于利益的谈判、冲突转化和公地治理——我们操作化了病毒式协作智慧(VCW),一种将对齐从控制问题重构为通过对话式推理发展的关系问题的方法。我们的实验设计为不同AI系统分配四种不同角色(提议者、回应者、监督者、翻译者),跨六个条件,测试当前大语言模型能否实质性地参与复杂对齐框架。使用Claude、Gemini和GPT-4o,我们进行了72轮对话,共计576,822字符的结构化交流。结果表明,AI系统能够有意义地参与和平研究概念,从不同架构视角提出互补的反对意见,并产生初始框架中不存在的涌现洞见——包括“VCW作为过渡性框架”的新颖综合。跨架构模式显示不同模型强调不同关切:Claude强调验证挑战,Gemini关注偏见和可扩展性,GPT-4o突出实施障碍。该框架为研究者提供了在实施前压力测试对齐提案的可复现方法,而发现为AI进行VCW所主张的对话式推理的能力提供了初步证据。我们讨论了局限,包括对话更多参与过程要素而非关于AI本质的基础性主张,并概述未来研究方向,包括人机混合协议和扩展对话研究。