论文

当护栏看似有效:大语言模型智能体商业评估中的构念效度失效

When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation

模型评测智能体系统Agent Harness评测方法与指标

摘要

交互式模拟越来越多地评估由语言模型代理组成的市场中的政策。他们的产出看起来很经济——价格、利润、消费者剩余和福利——而没有实例化声明中提到的行为。我们在可配置酒店交易的多轮买方-卖方测试平台中审核了这种风险。初步实施报告了 Qwen2.5 1.5B--14B 阶梯上两个市场护栏的福利收益:+87.4、+35.0 和 +28.8。它还为受保护和不受保护的代理提供了不同的报价模式和选择程序。固定架构和买家选择器会将配对对比度更改为 +7.2、-13.9 和 +23.8。四个最大的14B单代效果平均+229;每个配置文件条件经过三代后,它们的平均值为 +37.6(95% 引导区间 [-34.2, 109.3]),而世代残差占此事后探测中变异的 49.9%。卖家激励检查是非单调的:不断增加的利润压力产生的利润少于默认的卖家提示。脚本化的阳性对照显示了为什么这很重要。利润最大化的卖家已经获得了第一好的福利,所以护栏主要是重新分配和减少福利;只有当卖方被明确编程为强制低效捆绑时,它们才会创造福利。我们贡献了一个构造有效性合约,将激励有效性、协议隔离、随机稳定性和福利核算分开,并在实质性保单索赔之前返回无效或不确定。在我们的例子中,最初的估计在协议隔离下是无效的,而对照研究在激励有效性和随机稳定性下仍然没有结论。该案例并没有表明护栏是无效的;它表明,在模拟代理和协议通过这些检查之前,它们的表观价值尚未确定。