论文

训练后助手中的边界抑制不对称:过度扩张作为可控成本

Boundary Suppression Asymmetry in Post-trained Assistants: Over-expansion as a Controllability Cost

模型评测模型行为与机制分析

摘要

经过训练的语言模型助手通常会经过优化,以避免回答不足,鼓励完整、有帮​​助、谨慎和主动的回应。我们询问这种优化是否会产生不对称的可控成本:当用户明确要求更窄的答案时,哪些辅助行为仍然是可抑制的,哪些继续影响响应?我们将这个问题作为边界抑制不对称性来研究。跨多个高级响应维度的即时调查表明选择性成本,集中在“太多辅助”方向,例如过度完成、额外帮助和反回答不足。使用从共享基础模型派生的受控辅助策略变体,我们发现反回答不足策略比匹配边界控制评估下的基线更难拉回,而最小边界变体通常避免直接边界控制比较中的这种反侧向上移动。面向机制的探测指向更长的默认输出、纯 EOS 故障、不确定性补偿和局部连续偏差,而稳健性检查保留了共享系统和更大规模设置下的主要反超基线排序。证据支持混合计划/停止帐户,其中内容预算超调和持续持久性共同使边界纠正变得更加困难。总体而言,后训练 可能会产生特定方向的可控性成本:一些有用的辅助倾向仍然很容易被调用,但很难在本地抑制。