论文
LiteTrajEval:生产AI智能体的轻量量规引导轨迹评估
Lightweight, Rubric-Guided Trajectory Evaluation for Production AI Agents
摘要
轨迹评估对提升基于LLM的Agentic 智能体可靠性至关重要,但生产使用使其反复运行代价高昂。现代智能体生成含工具调用、观测、重试与外部输出的长轨迹,而并非所有原始token对诊断同等有用。我们提出LiteTrajEval——预算有界的轻量轨迹评估架构:离线导出紧凑的领域特定规则画像,在线预处理每条轨迹、标记启发式失败信号、在固定全局预算下序列化,并调用单次量规引导的LLM裁判产出结构化诊断报告。在公开的Magentic-One风格与τ-bench风格轨迹数据集上评估:相对AgentRx,LiteTrajEval在Magentic-One上把失败定位与人工标注的对齐提升约20-35个百分点、τ-retail上至多23点,同时成本降约6倍、评估时间降8倍以上。该方案也已部署于我们的企业智能体平台。