论文
ParEvalLayer:局部LLM Agent评估何时足以支撑决策
ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision
摘要
LLM-代理评估往往在完整的基准测试完成之前产生任务结果。报告部分分数是诱人的,但它们并不能表明观察到的任务是否支持完成评估时的相同结论。早期的任务可以省略基准测试中的重要部分,而先运行较便宜的任务可以扭曲观察到的样本,且只决定容易对齐的对的任务规则可以显得准确,而留下许多比较未决。我们引入ParEvalLayer,这是一个决策层,它读取两个代理系统的配对结果,并在选择好的比较策略之前选择比较。对于每个部分的运行,它记录测试代理系统是否比要求的金额更好,是否不更好,是否需要更多的证据,或者是否应该放弃。我们通过重播完成的公开基准测试数据来评估ParEvalLayer,假设每个评估在完成之前停止。在每个点,ParEvalLayer使用到目前为止观察到的成果来应用策略;如果它达到两个比较判断中的一个,我们检查那个判断是否与完成的数据匹配,对于同一个系统对。使用主要比较规则,三个公开基准测试在观察到15%到25%的任务结果后,与完成的评估相匹配。其他基准测试需要更多的任务结果。这种变化显示了为什么仅报告部分分数是不够的:报告还应说明决策规则和剩余的比较数量。