论文
AI工作流程应该什么时候发布?黑盒生成验证系统的始终有效的推理
When Should an AI Workflow Release? Always-Valid Inference for Black-Box Generate-Verify Systems
摘要
支持 LLM 的 AI 工作流程越来越多地通过迭代生成-评估-修改循环产生输出。每次迭代都可以改进候选,但它也会创建一个发布决策:何时停止并输出当前结果?这提出了统计挑战,因为部署时评估器分数是自适应生成并重复监控的,但通常用于校准的似然模型或可交换性假设不可用。我们为现有的生成器-评估器管道提出了一个始终有效的发布包装器。包装器构建高分失败的硬负参考池,根据该池校准部署时评估器分数,并通过电子流程积累结果证据。这区分了两个角色:参考池将黑盒分数转化为保守证据,而电子流程在可选停止下提供有效性。理论上,我们表明保守的参考池可以对不可行任务(即给定工作流程无法生成可靠解决方案的任务)的发布概率产生有限样本控制。我们还描述了相同的保守规则仍然可以实现对可行任务的非平凡释放的条件。在 MBPP+ 编码代理案例研究中,包装器相对于基线停止规则减少了过早的错误发布,同时仍然发布工作流重复积累适度支持证据的任务。