论文
Why2Speak:弃权动作策略的忠实推理
Why2Speak: Faithful Reasoning for Abstaining Action Policies
摘要
许多智能体系统必须反复在行动与弃权之间做出选择,这使忠实推理对监督很重要:一个解释只有反映产生该动作的计算时才有用。我们通过多方对话中的干预时机来研究这一问题:助手必须决定是发言还是保持沉默。这一设置暴露了类别不平衡、不对称的动作成本,以及暴露推理可能改变被审计策略的可能性。使用Qwen3-8B,以带或不带思维链推理解码,我们比较了直接决策策略、推理策略、监督微调和强化学习。我们发现一种能力-可审计性权衡:最强的直接策略达到更高质量,但不暴露任何可检查的推理;而推理策略提供了一份轨迹,代价是更低的表现,尤其是真实干预机会的召回。监督微调要么压制推理、要么保留推理却不改进决策质量,而强化学习也未能改进推理策略。我们识别出这一失败的一个机制:当采样的rollout全部选择同一动作时,组相对目标在自信错误的提示上不提供学习信号。受控激活探针和行为消融表明,标准的忠实性方法可能夸大“暴露的推理反映底层决策过程”的证据。基于概率的指标在自信决策下饱和,探针容易受类别不平衡和文本泄漏影响,而推理消融可能把推理内容与推理模式的变化混淆。这些结果共同表明,暴露推理可能改变智能体的动作策略,而不仅仅是使其可被观察。我们为评估能行动或弃权的智能体的基于推理的监督提供了控制手段。