论文

知识与权限所在之处改变智能体基准能分辨什么

Where Knowledge and Authority Sit Changes What an Agent Benchmark Can Resolve

智能体系统Agent任务评测

摘要

多数智能体基准将事实、工具与权限放在单一接口之后。真实组织将它们分散到人之间。Incognita追问:当任务与成功标准保持固定而访问方式改变时会发生什么。我们将十八个客服任务变换为三种设定:直接访问、单一已知中介——以及六个能力需被发现的角色隔离参与者。跨四模型864次试验:社交访问降低每个模型的成功率;预设区间对两个模型排除零。受测最新模型gpt-5.6-sol取得最高的社交访问成功率0.65——较集中式间接访问下降0.11——区间包含零。探索性比较在社交访问下区分了六对模型中的五对——而两个集中式设定在该样本量下均未区分任何模型对。事后任务分块检验中——三个成对交互p值经多重性调整后仍显著。相对参照读者将更大差距与未能获取所需信息相关联。由于数据无法区分被评智能体的无效请求与模拟参与者的不准确回复——读者的标签描述轨迹在哪里停止——而非模型为何不同。