论文
AdvPlan-Bench:结构化计划生成代理的对抗性评估
AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents
摘要
结构化计划生成代理通常被视为计划具有孤立的质量,但许多实际的规划任务需要询问当另一个代理可以搜索响应时候选人的行为如何。我们引入了 AdvPlan-Bench,这是一个用于结构化计划生成代理的对抗性评估的离线基准。贡献是一个一般的评估对象:一个类型化的计划、一个对抗性响应集、选择器诊断和可追踪的候选前沿指标。 AdvPlan-Bench 将计划表示为具有可选分支的类型化行动链,分配综合质量分数,将相反的计划与蓝色与红色优势和纳什差距诊断进行比较,并使用透明的启发式规则评估定性约束的一致性。在跨越 5 个规划模板的 150 个综合场景中,相对于单样本响应,抽取 8 个候选响应的抽样最佳响应策略将蓝色优势从 0.518 降低到 0.486,将蓝色获胜率从 0.900 降低到 0.820。离线 LLM 策略合约基线达到 0.496 蓝色优势和 0.700 蓝色获胜率,而两阶段多代理委员会获得 0.509 蓝色优势和 0.813 蓝色获胜率。对 600 条评级记录进行的三名评级者评分标准敏感性研究得出 0.978 的评级者间一致性。 AdvPlan-Bench 不是一个运营规划器,并且不提供有关现实世界决策质量的证据;它是一个可重复的基准工件,用于研究对抗性计划评估、响应预算敏感性、候选边界以及多主体批评和修订痕迹。