论文
中等规模语言模型多跳上下文推理的扩展趋势
Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models
摘要
我们对大型语言模型的多跳上下文推理进行受控研究,清晰展示了任务—方法分离现象:基于规则的模式匹配在结构化信息检索上成功率达100%,但在需要跨文档推理的任务上仅6.7%;而基于LLM的多Agent系统呈现相反模式,在规则方法失败的任务上最高取得80%。利用跨四个模型(LLaMA-3 8B、LLaMA-2 13B、Mixtral 8x7B、DeepSeek-V2 16B)共120次试验的合成评测框架,我们报告三项关键发现:(1)多Agent放大效应取决于基础能力:统计显著的增益仅出现在推理能力足够的模型上(LLaMA-3 8B的p<0.001,Mixtral的p=0.014),提升最高达46.7个百分点,而较弱的模型没有收益,表明是放大而非补偿;(2)活跃参数预测推理性能:Mixtral的表现与其约12B活跃参数而非47B总参数相符,与推理期计算驱动MoE架构推理能力的假设一致;(3)架构质量很重要:LLaMA-3 8B尽管参数更少仍优于LLaMA-2 13B,与已知的训练改进一致。我们的结果为关于多Agent协作与MoE扩展的直觉提供了受控定量证据,同时强调多Agent收益依赖于基础模型能力。我们发布该评测框架,以支持中等规模模型推理的可复现研究。
