论文
相同的信号,相反的含义:LLM 智能体的定向自适应学习
Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents
摘要
LLM 代理的自适应测试时计算旨在仅在提高性能时调用额外计算。现有方法通常使用基于置信度、不确定性或难度的门,假设从门控信号到计算需求到计算值的固定方向。这使得门控成为效用校准问题:门控信号应与额外计算是否改善基本策略的最终结果相一致。我们证明这种一致性是不稳定的:相同的信号预测在一种环境中采样轨迹的好处和在另一种环境中采样轨迹的危害,即使任务是固定的,跨环境和主干网也会出现逆转。因此,错误方向的门会通过精确选择有害状态来降低性能。这种逆转反映了计算需求和计算适用性之间更深层次的区别:高度不确定性信号可能表明决策困难的状态,其中采样轨迹有助于比较替代方案,或干预不适合的状态,其中当前上下文不支持有用的基于采样轨迹的改进。在这种双源模型下,固定方向门在异构设置中是不可靠的。为了解决这个问题,我们提出了 DIAL(方向信息自适应学习),这是一种通过与信号无关的反事实探索训练的稀疏门,用于学习每个(环境、主干)状态特征的效用方向。在六种环境和三个骨干网中,DIAL 比固定方向基线产生了更强的总体成功成本权衡。