论文

被说服,但不知情:激励不一致的见证人无法在情境中立足

Persuaded, Not Informed: Incentive-Misaligned Witnesses Defeat In-Context Grounding

模型评测模型行为与机制分析

摘要

语言模型代理越来越多地回答有关客户关系管理 (CRM) 记录的问题,例如是否对销售线索进行资格认证。我们确定了一个更强大的模型无法解决的失败模式:当上下文包含有乐观动机的一方(这里是销售代表,CRM 中记录的证人)的断言时,模型将该断言视为证据,并清除公司自己的记录认为不可接受的交易。在 CRMArena-Pro 的 100 项潜在客户资格认证任务中,该代表在每次通话中都提出了可接受的时间表,并在 76 次通话中提出了可接受的预算;在此类断言与价目表和安装政策相矛盾的 31 项任务中,仅阅读成绩单的模型就在 31 项任务中的 29 项中清除了交易。来自四个提供商的七个模型的签名是一致的(87-97% 被误导);规模和明确的推理不会带来任何阻力。 35 个真正的失败中只有 3 个不涉及断言:失败是说服,而不是丢失信息。我们贡献了一种诊断方法,而不是一种架构:(i) 将说服力与信息差距分开的桶分析,(ii) 相同信息控制,显示向模型提供记录将严格准确度从 41 降低到 18,同时提高召回率 - 精确度崩溃 - 以及 (iii) 计算步骤控制,保持提取固定,仅改变计算预算和时间线的人。裕度范围从廉价模型的 42 点到已经正确计算的模型的 2-5 点;在最强的模型上,手臂位于置信区间内,因此该模式是一致的方向和健全性属性,而不是经过验证的性能底线。我们预先指定返回否定结果的泛化测试,描述前提条件(在输入中精确指定的策略),并发布所有评估工件。