论文
面向协作式对话结果的多个大语言模型智能体系统动态治理
Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes
摘要
当两个目标结构性对立的大语言模型(LLM)智能体进行多轮交互时,共享目标函数的缺失所产生的不是竞争而是崩溃:访客缴械顺从,站点智能体不再变换策略,对话在未达成任何一方既定目标的情况下终止。本文探讨一个控制论治理层能否替代这一缺失的目标函数。Experience Orchestrator(EO)在一个模拟金融服务环境中应对该问题:站点智能体引导访客联系顾问,而访客保持心理上真实的抗拒。EO通过三种机制治理联合轨迹:一个从真实世界网络分析校准内容臂的上下文老虎机(Contextual Bandit,CB)、一个通过动态模式约束强制行为一致性的PID控制器,以及一个维护访客意图概率模型的POMDP信念跟踪器。在60,000次模拟中,EO在高意向顾问联系率上取得+32个百分点的提升(78.1%对朴素LLM控制的46.1%),其中CB变体选择解释了97%的因子间结果方差——这证实是治理策略而非环境初始条件决定了轨迹的最终走向。角色层面分析揭示两种不同情形:对于没有自然转化倾向的访客,治理层是系统能用与不能用的分界;对于已接近对齐的访客,朴素LLM的共情默认行为基本足够。所有发现都以LLM对LLM的模拟为条件。PID控制器尚未针对真实人类的不可预测性进行校准,在真实流量上验证EO是关键的下一步。
