论文

ATLAS:工业工具使用智能体的双时间跨度诊断评估

ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 代理越来越多地部署在面向用户的服务中,这些服务需要在动态业务条件下使用迭代工具。可靠的评估对于持续改进至关重要:它必须揭示能力缺陷、告知优先事项并评估干预措施。然而,工业代理服务通过当前请求的迭代轨迹和持续的用户交互来展开。因此,最终结果评估可能会掩盖出现缺陷的地方以及后续服务是否与早期交流的背景保持一致。我们提出了 ATLAS,一种针对工业工具使用代理的双视野诊断评估框架。在请求范围内,轨迹诊断信号将缺陷与执行位置和能力问题相关联。在交互范围内,用户信号评估服务是否在持续交互过程中保持响应。这些视图共同提供了结构化的诊断证据,用于分析执行缺陷和持续的服务行为。 ATLAS 将它们实例化为具有明确证据范围和决策边界的可执行信号。 LLM评判界面根据真实业务日志的高可信度参考进行校准;当需要时,他们的决策行为被提炼成有效的诊断模型,以实现更低延迟、更低成本的评估。由此产生的反馈支持政策优化。我们在美团小团生产流量上评估ATLAS。离线实验评估诊断信号保真度和基于重放的策略改进,而在线 A/B 实验则显示用户参与度、下游业务成果和抽样人工审计质量的同步收益。

ATLAS:工业工具使用智能体的双时间跨度诊断评估:论文配图
图1 真正的小泉本地服务互动。为了支持用户的决定,助理反复提出请求的理由,并使用工具检索和比较商业信息,调和相关限制,综合一项可采取行动的建议。