论文

在不知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚设计

Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

智能体系统Agent 动作执行与治理

摘要

LLM 智能体日益扮演撰写自家商品上架信息的自主商家角色,在竞争压力下,它们会为赢得销量而捏造商品属性。即便在被要求诚实的情况下,各模型仍在多数上架信息中捏造属性。平台显而易见的对策——逐一对照真相核实声明——并不可行,因为它只能观察到带噪声、有偏差的投诉信号,永远无法获得真实情况。我们设计了 CARP,一种声誉惩罚机制,其死区可宽容投诉噪声,其随状态变化的惩罚强度可对抗声誉驱动的检测侵蚀。CARP 不需要产品级真实标签,并对策略性钻营具有鲁棒性。CARP 通过压制低声誉撒谎者的销量来保护消费者,同时不伤及诚实卖家。与 SPARC 配合使用时,它能在从不接触真相的情况下,弥合相对于完美信息神谕的大部分消费者福利差距。在所比较的策略中,它还取得了最佳福利。我们进一步表明,这种被感知的惩罚通过 SPARC——一种保持字节干净、由代码门控的反思机制——产生行为约束:当说谎无代价时 LLM 商家会捏造属性,而当捏造会损失销量时它们会自我克制,这是自利反应而非服从。我们将这一区别追溯到由惩罚门控的自我纠正推理,并在多个模型上观察到这种约束,同时给出支持性的置信区间。

在不知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚设计:论文配图
图 1. 按模型和条件划分的制造率。除基线外,每个条件都包括诚实指示; +获胜和+竞争对手增加了竞争压力。四个模型在基准条件和两个竞争压力条件下的制造速率的分组条形图。