论文

HARP:异质偏好下的显式角色推理与 LLM 编排

Large Language Model Orchestration under Heterogeneous Preferences via Explicit Persona Inference

智能体系统Agent 协作

摘要

LLM 编排研究编排器如何协调一组自治的智能体以实现共同目标或最大化集体福利。 智能体通常是异构的,每个人都有自己追求但不透露的私人偏好。从行为中推断出这种隐藏的偏好一直是博弈论和多智能体系统长期研究的主题。核心挑战在于保持对每个智能体偏好的信念,并根据智能体观察到的行为更新它。现有的 LLM 编排器将这种信念作为提示文本携带,没有明确的更新规则。这使得早期错误持续存在并传播,而不是被纠正。因此,我们提出 HARP (通过偏好推理的异质偏好智能体 oRchestration),这是一个将信念从提示中移出的新颖框架。具体来说,HARP 在一组有限的候选偏好上为每个智能体维护一个数字后验,并根据贝叶斯规则以封闭形式更新它。语言模型仅提供动作和每个候选者的可能性,因此估计与其推理脱钩。我们证明,当分解精确时,HARP 可以获得与显式联合推理相同的 $\tilde O(\sqrt K)$ 贝叶斯遗憾。此外,HARP\textsuperscript{+} 通过对区分候选者的操作进行奖励来增强规划,因此即使最佳操作没有提供信息,推理也会继续进行。三个基础的实证结果,从偏好完全决定的回报,到依赖于偏好的回报,再到显式联合推理不可行的尺度,表明 HARP\textsuperscript{+} 是我们理论识别的类别中最强的非预言方法。

HARP:异质偏好下的显式角色推理与 LLM 编排:论文原图
图 26:焦点与关节讨价还价边界。 $\beta_{\mathrm{obj}}=0$是oracle_joint(J); $\beta_{\mathrm{obj}}=1$ 是 oracle_focal (F)。增加焦点收益可以减少最小参与者剩余,这解释了为什么焦点策略可以在不违反上限的情况下超过联合预言机的焦点分数。