论文

STEER:经由约束质量-多样性搜索的推理时风险控制

STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search

模型推理推理搜索与路径规划

摘要

为平均正确性训练的大语言模型(LLM)常出现模式坍缩,在多个回答都可能合理的任务上产生狭窄的决策行为。这一局限在临床分诊等序数型决策场景中尤为成问题,因为标准对齐消除了基于上下文约束权衡特异性与敏感性(ROC 工作点)的能力。我们提出 STEER(Steerable Tuning via Evolutionary Ensemble Refinement),一个免训练框架,重新引入这种可调节的控制。STEER 通过离线的、受限的质量-多样性搜索构建自然语言人格集合,在促进行为覆盖的同时强制最低安全性、推理与稳定性阈值。在推理时,STEER 暴露一个单一、可解释的控制参数,将用户指定的风险百分位映射到所选人格,产生决策保守程度的单调调整。在两个临床分诊基准上,与基于温度的采样和静态人格集合相比,STEER 实现了更广的行为覆盖。与一个代表性后训练方法相比,STEER 在无歧义的紧急病例上保持显著更高的准确率,同时对歧义决策提供可比的控制。这些结果表明 STEER 是一种保全安全性的风险控制范式,能够在不损害领域能力的情况下引导行为。

STEER:经由约束质量-多样性搜索的推理时风险控制
图1:STEER 重新引入风险工作点。 问题:标准模型表现出模式坍缩,使有效分歧的分布(灰色曲线)收缩;它们还不可调节,对提示词的反应反复无常(蓝色箭头)。 STEER 框架:STEER 通过受约束的质量-多样性进化搜索来增强该分布,从而创建一个确定性的保守度旋钮(P)。 情境感知控制:系统生成一条可调节的有序性能曲线(类似于 ROC),使用户能够选择满足特定灵敏度/特异度要求精确工作点(P)。