论文

PromptShift-CRC:提示和域转移下基础模型的漂移感知保形风险控制

PromptShift-CRC: Drift-Aware Conformal Risk Control for Foundation Models Under Prompt and Domain Shift

模型评测鲁棒性、公平性与可信度评测

摘要

基础模型现在用于收到的提示可以快速更改的环境中。用户变化、主题变化、政策变化,模型可能会突然面临一种在校准数据中很少见的请求。这使得固定校准存在风险。保形预测和保形风险控制提供了与模型无关的方法来控制误差,但当校准数据仍然看起来像未来数据时,它们的效果最佳。本文开发了 PromptShift CRC,这是一种在提示和域转移下用于基础模型输出的漂移感知共形风险控制方法。该方法嵌入提示和响应,测量当前提示流距离校准池有多远,对相关或最近的校准示例给予更多权重,并在观察到违规行为后在线更新风险级别。它报告了三个实用的诊断:已实现的风险误差、提示漂移和有效校准大小。我们给出了该方法控制风险的条件,直至分布不匹配和加权分位数不确定性的项。在综合的提示转变基准中,静态共形风险控制在漂移后急剧失败,而提示转变-CRC 在所考虑的自适应基线中提供了最佳覆盖范围。然后,我们在公共基准衍生流上评估相同的校准层的问题回答、毒性、摘要事实性和长上下文幻觉风险