论文

多头潜在控制:LLM 代理决策的统一接口

Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

智能体系统Agent 规划

摘要

大语言模型 越来越多地被部署为代理,但可靠的代理行为需要的不仅仅是下一个词元预测。在推理时,代理最好可以决定是否继续其当前推理、遵循更强的模型、请求附加信息、调用外部工具或在给定设置下放弃。现有方法通过提示级路由、外部编排或特定于任务的 微调 来解决这些决策,这些方法主要依赖于输入侧信号,并且随着模型主干的发展,通常成本高昂且难以维护。我们询问此类控制决策是否可以直接从模型的潜在生成过程中推断出来。我们引入了多头潜在控制,这是一个轻量级层,可以从冻结的 LLM 或 VLM 中读取隐藏状态轨迹,以产生部署时控制信号。能力负责人预测当前模型是否可以解决实例或应该听从更强大的合作者,而解决方案负责人预测适当的解决决策澄清、工具使用、弃权或直接回答。两个头仅接受来自同一冻结 LLM 主干的潜在踪迹的训练,从而无需修改模型即可实现事后适应。在语言和视觉语言设置中,多头潜在控制持续改善多模型系统的质量成本权衡,从而实现部分代的早期切换和更准确的干预决策。在路由执行(小型+大型模型)中,它在 AndroidWorld 上将大型模型的使用率降低了高达 90.7%,在基准测试中平均降低了 27-53%,同时保留了大部分大型模型的性能。此外,学习到的控制信号提高了工具使用决策质量,相对得分增益高达 +158%,错过的所需工具调用减少了 65.5%。