论文

共享输入如何破坏推理Agent的独立随机选择

Shared and structured inputs undermine collective random choice by reasoning AI agents

模型评测智能体系统Agent 协作鲁棒性、公平性与可信度评测

摘要

随机选择广泛应用于资源分配和审计,这使得可靠的实施对于人工智能Agent系统至关重要。六个推理模型的行为测试揭示了基于标识符的选择中使用的阈值和可分性规则。对于遵循阈值的 GPT-6 Sol 和 Gemini 3.8 Flash,单Agent测量前瞻性地预测共享标识符下的相关参与和具有公共时间戳位的不同标识符下的偏向参与。更改日期、格式和标识符标签会显示这些预测何时成立。独立随机化的显式指令减少了但没有消除共享输入相关性。为了测试监督的影响,我们要求四个模型随机选择客户请求进行人工审查。 GPT-6 Sol 接近目标速率,同时从标识符中进行可预测的选择;其他人很少选择请求。所有四人都密切关注提供的随机抽签。这些发现揭示了仅选择率所忽略的集体和审计漏洞,使输入依赖偏差、相关性和可预测性成为Agent评估的中心目标。

共享输入如何破坏推理Agent的独立随机选择:论文原图
扩展数据图 1 ||研究 1 细节。 a,针对图 2c 中未显示的 7 个设置的 64 个设计标识符的每个决策,如图 2c 所示(原始标识符;黑线,目标;点,可被 1/q1/q 整除的标识符),以及每个目标的阈值和残留效应。 b,对于同一标识符的一种设置的两个答案(q=1/3q=1/3;64 个标识符,GPT-5.4 mini 63 个)以及 Sol 和其他设置(qq 从 1/5 到 1/3;192 对),具有 95% Wilson 间隔的相同决策的份额;灰色刻度线,以观察到的比率独立绘制。重新采样标识符给出了类似的间隔(补充说明 3)。 c,对于每个设置,参与由目标设置的设计标识符(如图2中的符号;空心符号和虚线,推理;粗虚线,目标)。设计的标识符中有一半满足 q=1/3q=1/3 的每个规则,因此这些比率超过了文本中给出的均匀随机标识符的自然比率。没有推理,克劳德在每个目标上都以相同的方式回答每个标识符。 d,在 q=1/2q=1/2 时:偶数标识符和低于一半的价值分数对用字母 A 回答和参与的影响(四个标签和顺序层内的差异,平均值;原始标识符,第一个答案;探索性)。型号名称缩写如正文中所示:Sol、GPT-6 Sol;卢娜,GPT-6 卢娜;双子座、双子座3.8闪存;克劳德,克劳德十四行诗5。