论文

两院模型:并行语言模型之间的双向隐藏状态耦合

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

模型架构新型架构

摘要

现有的多模型和工具增强系统通过生成文本进行通信,并通过输出词汇序列化每次交换。两个预训练的语言模型可以通过连续的并发通道进行协调吗?双院模型通过可训练的神经接口将两个冻结的语言模型耦合到其中间隐藏状态。在每个生成步骤中,两个模型都同步运行:主模型驱动任务,而辅助模型操作工具、解决约束或执行代码,两者都通过翻译网络和学习抑制门(组合参数的 $\sim$1\%)调节彼此的激活。门仅从任务丢失中学习选择性通信协议,没有规定的格式。我们跨三个工具后端演示了该机制。在算术上,将两个 0.5B 模型与计算器耦合可将精度从 36% 提高到 96%。在逻辑网格谜题中,将两个 0.6B 模型与 Z3 求解器耦合可实现 ZebraLogic 上未增强基线的 1.7 美元\倍$。在数学推理方面,与 Python 沙箱结合使辅助程序能够仅从隐藏状态信号生成特定于问题的代码,而无需看到问题文本。