论文

GPS-Bench:用于自动化政策分析的治理政策基准

GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis

模型评测基准与评测资源

摘要

政策分析需要的不仅仅是预测一项提案是否会通过:它还需要确定谁将受到影响、这些参与者如何应对以及接下来会发生什么。基于LLM的政策模拟对这些过程进行了大规模建模,但当从未将合理的行为与观察到的结果进行比较时,很难确定其有效性。我们引入 GPS-Bench,这是一种基于证据的治理政策模拟基准,利用立法记录、游说披露、监管文件、公司备案、经济数据和其他公共证据,将政策与相关参与者、参与者行动和下游影响联系起来。演员是根据有日期的记录重建的,而不是作为原型提示的,因此角色是一个有出处的证据对象;人工注释池构成了金牌评估集,而由单独的LLM从检索到的证据中标记的案例则被视为银牌监督,而不是测试标签。由于每种推理模式都会读取相同的基态并发出相同的模式,因此 GPS-Bench 转变为“多智能体模拟有帮助吗?”进行受控比较:我们对比联合推理、独立和通信的参与者代理、基于图的方法和针对一种策略状态的权重级别微调。对接地记录进行微调可以给出最强的参与者级影响预测,并且分解无法击败它;分解增加的是机制。特工们持有私人的、不相同的证据,每个人都看到自己的暴露条款,并向指定的合作伙伴提出具体的联合提案,他们提供什么,他们需要什么回报,以及为什么共同行动胜过单独行动,这样形成的联盟就可以根据记录中的承诺进行检查。因此,GPS-Bench 为研究证据、行为者建模和多主体交互何时改善政策结果的预测和解释提供了一个共同的经验设置。

GPS-Bench:用于自动化政策分析的治理政策基准:论文配图
图A6:哪些智能体选择说服/实际说服(开放手臂,7 138{,}138) 目标来自4 2544{,}254 投在33轮通信上;单元格 = 投从行演员到列演员,按活动计,最高1212个行为者)。智能体绝大多数针对的是同一步的行为者(数字为0.770.777)。 他们建立联盟,而不是说服对手。最强大的优势是政府/监管核心(州立法机构左翼右翼管理者)和产业集团(企业左翼右翼新手),消费者/公众是最有礼貌的目标。