论文
MIRAGE:强化学习指导的多视角创意语言模型推理
MIRAGE: Multi-Perspective Creative Language Model Reasoning with Reinforcement Learning Guidance
摘要
大型语言模型 (LLM) 的最新进展彻底改变了人工智能以及人类与人工智能的交互方式。尽管取得了令人瞩目的进步,大语言模型仍难以应对复杂的数学、科学和逻辑任务。受人类认知灵活性(我们动态切换心理视角的能力)的启发,我们提出了 MIRAGE(通过代理引导探索的多视角推理时推理),这是一种新颖的推理时创造性思维框架。 MIRAGE 包括一个优先考虑有效概念视角(例如代数、概率)的选择器和一个按顺序解决任务直到出现可信解决方案的推理器,否则聚合多个视角。在 GSM8K、MATH500、MMLU-Pro 和 Game-of-24 基准测试上进行测试,MIRAGE 始终优于诸如 Chain-of-Thought 和多样化提示集成等方法,以最小的推理开销显着提高了准确性,为实际应用提供了可扩展的解决方案。