论文

通过难度感知路由和不确定性引导聚合进行自适应多专家推理

Adaptive Multi-Expert Reasoning via Difficulty-Aware Routing and Uncertainty-Guided Aggregation

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 在数学推理基准测试中表现出强大的性能,但它们的性能在不同难度级别的问题上表现不一致。本文描述了自适应多专家推理(AMR),这是一个通过动态适应策略进行推理来关注问题复杂性的框架。专注于问题文本的敏捷路由系统可以预测问题的难度和不确定性,并指导可重新配置的采样机制来管理生成的广度。三位专业专家创建候选答案,并在多个校正和最终确定阶段进行修改。神经验证器评估响应的正确性,而基于聚类的聚合技术则根据共识和答案质量的组合来识别最终候选答案。在 GSM8K 数据集上进行评估时,AMR 在仅使用原始训练数据的情况下实现了 75.28% 的准确率。这一结果优于大多数在合成数据上训练的类似 7B 模型。这表明使用基于难度的路由和不确定性驱动的聚合的模型在提高数学推理模型的稳健性方面是高效且有效的。