论文

面向协作式对话结果的多个大语言模型智能体系统动态治理

Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes

智能体系统Agent 协作

摘要

当两个目标结构性对立的大语言模型(LLM)智能体进行多轮交互时,共享目标函数的缺失所产生的不是竞争而是崩溃:访客缴械顺从,站点智能体不再变换策略,对话在未达成任何一方既定目标的情况下终止。本文探讨一个控制论治理层能否替代这一缺失的目标函数。Experience Orchestrator(EO)在一个模拟金融服务环境中应对该问题:站点智能体引导访客联系顾问,而访客保持心理上真实的抗拒。EO通过三种机制治理联合轨迹:一个从真实世界网络分析校准内容臂的上下文老虎机(Contextual Bandit,CB)、一个通过动态模式约束强制行为一致性的PID控制器,以及一个维护访客意图概率模型的POMDP信念跟踪器。在60,000次模拟中,EO在高意向顾问联系率上取得+32个百分点的提升(78.1%对朴素LLM控制的46.1%),其中CB变体选择解释了97%的因子间结果方差——这证实是治理策略而非环境初始条件决定了轨迹的最终走向。角色层面分析揭示两种不同情形:对于没有自然转化倾向的访客,治理层是系统能用与不能用的分界;对于已接近对齐的访客,朴素LLM的共情默认行为基本足够。所有发现都以LLM对LLM的模拟为条件。PID控制器尚未针对真实人类的不可预测性进行校准,在真实流量上验证EO是关键的下一步。

面向协作式对话结果的多个大语言模型智能体系统动态治理:论文配图
图1:Experience Orchestrator:逐轮循环与轨迹视图。左,逐轮治理循环。在每次交互中,CB从访客的上下文中选择一个内容臂;PID控制器计算阻力误差信号;Schema层把PID输出转换为结构化响应边界(ρ↓\rho\,\downarrow表示治理下阻力下降);信念追踪器更新意图状态上的Dirichlet分布,并反馈给CB用于下一轮。右,轨迹视图(t0→tTt_{0}\to t^{T})。访客带着其累积的访客状态到来(t0t_{0})。CB选择一个与人格奖励先验对齐的臂,开始阻力下降(t1t_{1})。PID控制器治理后续轮次,锁定schema边界以维持下降轨迹(t2t_{2}–t3t_{3})。当ρT<ρ0\rho^{T}<\rho_{0}且选择了Contact臂时发生终端转化(tTt^{T})。