论文
风险意识适应性评估:在有限预算下发现高影响力的失败
Risk-Aware Adaptive Evaluation: Finding High-Impact Failures Under Limited Budgets
摘要
评估交互式Agent的成本很高。Agent行为是随机的,因此必须通过重复试验来衡量可靠性,但失败很少见,而且其重要性差异很大。标准基准统一使用此预算:只读查找的采样频率与不可逆转的支付操作的采样频率相同。相反,我们将评估制定为顺序分配问题。给定固定的试验预算和一组失败行为未知的场景,哪些场景应该运行并再次运行?我们提出了一种具有风险意识的上下文汤普森采样策略,该策略将预执行场景上下文向量和固定影响分数与评估期间观察到的失败结果相结合,并通过离线重播超过 70 个 $τ$ 基准航空公司场景和 824 个记录的试验来对其进行测试。我们的主要结果是在最小的预算下:仅进行 50 次试验(语料库的 $6\%$),该策略就恢复了预言机可以发现的影响加权失败的 $86\%$,而统一分配的费用为 $25\%$。在相同数量的试验下,它发现了 3.5倍的影响加权失败(215.4 比 62.2),每美元提供5倍的发现,并将浪费在永不失败的方案上的预算从 34%减少到 2.8%。我们的其余分析证明并验证了这一结果:预算扫描显示,随着预算接近语料库大小,优势会缩小,配对显着性测试表明,场景上下文主要有助于小预算,而基于后验的探索有助于中等预算。因此,风险意识自适应分配在评估预算最稀缺的情况下最有帮助。