论文
驯服思考者:自适应 LLM 推理的条件熵整形
Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning
摘要
基于熵的深度推理已成为提高 大语言模型 (LLM) 推理能力的一个有希望的方向,但现有方法往往要么不加区别地增加响应长度,要么以牺牲准确性为代价缩短响应。为了更好地平衡这种权衡,我们引入了条件熵整形(CES),这是一个动态控制 词元级 响应熵的框架,使 LLM 能够针对简单问题生成简洁的解决方案,同时鼓励对困难问题进行更深入的探索。 CES 基于 DAPO,使用 词元级 熵作为不确定性信号,并应用条件双向策略:它在正确的推理路径上惩罚高熵“分叉点”词元以提高简洁性,并在不正确的路径上奖励它们以鼓励探索和纠错。我们在 DeepSeek-R1-Distill-7B 上实现 CES,并在 12 个数学基准上对其进行评估。相对于 DAPO,CES 持续提高了平均准确度,同时缩短了响应长度,并且补充实验在较小的 1.5B 主干和域外基准上显示了类似的趋势。