论文
深度交互:面向大型推理模型的高效人机交互方法
Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models
摘要
思维链(CoT)推理的涌现显著增强了大语言模型(LLM)处理复杂多步任务的能力。但当错误发生时,当前的交互方式通常是重新生成另一个可能再犯错的响应,或由用户费力地在后续轮次标记错误步骤——换来的常是“你说得对,我这里错了”之后类似错误重演。为解决该问题,我们提出Deep Interaction:一种用于精确纠正LLM推理错误的高效人工干预机制。我们的方法支持直接编辑原始响应:在保留正确推理步骤的同时修正错误部分。我们把编辑后的CoT精炼为蒸馏提示,进而引导LLM沿修正后的推理路径前进。实验结果显示:相较基线方法,我们的方法在STEM任务推理上把纠正成功率提升25%以上,并把token使用降低约40%。
