论文

Signals:面向智能体交互的轨迹采样与分流

Signals: Trajectory Sampling and Triage for Agentic Interactions

AI 基础设施可观测性

摘要

基于大语言模型的智能体应用日益依赖涉及规划、动作执行与环境反馈的多步交互循环。尽管此类系统已大规模部署,部署后的改进仍然困难。智能体轨迹数量庞大且非确定,逐一审查——无论是人工审查还是借助辅助LLM——既缓慢又成本高昂。我们提出一个轻量级的、基于信号的智能体交互轨迹分流框架。我们的方法从在线交互中计算廉价且广泛适用的信号,并将其作为结构化属性附加到轨迹上用于分流,在不影响在线智能体行为的前提下识别可能有信息价值的交互。我们将信号组织为一个粗粒度分类体系,涵盖交互(错位、停滞、脱离、满意)、执行(失败、循环)与环境(耗尽),并设计为无需模型调用即可计算。在广泛使用的工具增强智能体评估基准 $\tau$-bench 上开展的受控标注研究中,我们表明基于信号的采样取得82%的信息价值率,高于启发式过滤的74%与随机采样的54%,每条有信息价值的轨迹带来1.52倍的效率增益。该优势在不同奖励层级与任务领域间保持稳健,证实信号带来的是真实的逐轨迹信息价值增益,而非仅仅对明显失败的过采样。这些结果表明轻量级信号可以作为智能体系统实用的采样基础设施,并为偏好数据构建与部署后优化指出了一条路径。