论文

FaithSteer-BENCH:部署对齐的推理时转向压力测试基准

FaithSteer-BENCH: A Deployment-Aligned Stress-Testing Benchmark for Inference-Time Steering

模型评测基准与评测资源

摘要

推理时转向(inference-time steering)被广泛视为一种控制大语言模型(LLM)行为的轻量级、无需训练参数的机制,先前工作常常声称简单的激活层面干预能够可靠地诱发目标行为变化。然而,此类结论通常是在相对宽松的评估设置下得出的,这些设置忽视了部署约束、能力权衡与真实世界鲁棒性。为此我们提出 FaithSteer-BENCH,一个压力测试基准,在固定的部署式工作点上通过三道关卡式准则评估转向方法:可控性、效用保持与鲁棒性。在多个模型与代表性转向方法上,我们揭示了若干在标准评估下很大程度上被掩盖的系统性失效模式,包括虚幻可控性、对无关能力可测量的认知损耗,以及在轻微指令级扰动、角色提示、编码变换与数据稀缺下的显著脆弱性。关卡式基准结果表明,现有方法在面向部署的实用设置中并不必然提供可靠的可控性。此外,机制层面的诊断表明,许多转向方法诱发的是随提示条件而变的对齐,而非稳定的潜空间方向性偏移,这进一步解释了它们在压力下的脆弱性。因此,FaithSteer-BENCH 为未来转向方法设计、可靠性评估与面向部署的研究提供了统一基准与更清晰的分析视角。

FaithSteer-BENCH:部署对齐的推理时转向压力测试基准:论文配图
图2:FaithSteer-BENCH概览:经干净可控性、能力保持与压力鲁棒性三阶段评测转向方法,并转为逐门控部署裁决。