论文
AdaThinking-E:自适应思维的一元熵调节
AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking
摘要
多模态 大语言模型 通过结合明确的思维过程,展示了强大的文档推理能力。虽然这种功能显着提高了挑战性任务的性能,但当前模型将这种深度推理统一应用于所有问题,从而导致简单任务不必要的计算开销。这不仅会降低用户体验,还会对基准数据集的准确性产生负面影响。我们确定了对适应性思维机制的迫切需求,该机制可以根据问题的复杂性智能地确定何时进行推理。为了解决这个问题,我们提出了 AdaThinking-E,这是一种新颖的强化学习框架,可以通过单词元熵调节来学习适应性思维。我们的主要见解是,可以通过对关键决策标记的预测概率分布进行熵分析来量化模型对参与思考(或不参与思考)决策的信心。这一观察激发了我们的熵控制奖励机制:训练过程自然地从高熵探索(模型用不同的思维策略进行实验)过渡到具有自信、可概括的决策策略的低熵收敛。至关重要的是,这种方法使模型能够从本质上发现何时思考,而无需手动干预或外部难度标签。大量的实验表明,我们的方法使模型能够在复杂问题上准确,并且在不同文档任务中的简单问题上高效。