论文

校准您运送的物品:验证者引导的文本到图像生成的选择后风险控制

Calibrate What You SHIP: Post-Selection Risk Control for Verifier-Guided Text-to-Image Generation

模型推理推理验证与自校正

摘要

验证者引导的文本到图像系统越来越多地使用测试时搜索来选择、细化或停止多个候选者,但发布阈值通常在单个图像上进行校准。这会造成候选与策略校准不匹配:搜索会同时更改提示接收输出和发布哪个候选,因此候选级别的风险控制不一定意味着对发布输出风险的控制。我们通过提示重新加权和提示内选择来形式化这种估计偏移,并引入 SHIP(推理策略的选择感知保留校准)。 SHIP 根据保留的提示运行或重放完整的部署策略,使用独立的目标法官评估其实际发布的图像,并选择风险上限满足规定预算的最宽松的阈值。对于具有预先指定阈值网格的可重放策略,同时置信度控制提供有限样本有效性。固定、顺序和自适应 T2I 推理过程的实验表明,策略级校准可以恢复较低风险的操作点,同时暴露风险、覆盖范围和计算之间的策略相关权衡。在 FLUX N=16 的 GenEval2 上,合并候选阈值产生的释放风险为 0.310,而 SHIP 将其降低至 0.162。在 200 个缓存流分割中,固定网格证书没有目标交叉。因此,可靠的推理时间缩放需要校准由完整部署的策略引起的输出分布。