TRACE:一个自我进化的技能库,适用于一致的、具有限制意识的 LLM 座席
TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents
摘要
在面向用户的产品中可靠地部署 LLM 代理并不取决于原始的任务解决能力,而是取决于一致性和限制意识:在重复试验中以相同的方式表现,并识别何时不能或尚不能安全地满足请求。 CAR-bench 暴露了车载助手领域的这种可靠性差距:LLM 模拟的用户发出不完整或模糊的请求,要求代理通过多轮对话和工具使用来解决不确定性,同时严格遵守领域策略。即使是前沿模型也显示出它们至少可以解决一次的问题 (Pass@3) 与它们在试验中一致解决的问题 (Pass^k) 之间存在巨大差距。我们通过 TRACE(TRAjectory-Contrastive Evolution)弥补了这一差距,它迭代地改进了基于技能的代理的行为知识,而无需修改模型权重。这些知识被组织为模块化、可检索技能的技能库,每个技能都编码了一套独立的工具使用规则和行为指南。 TRACE 通过代理自我进化循环来发展这个银行:在每轮评估之后,它根据调用的技能对轨迹进行分组,并通过对比成功和失败的行为来完善每项技能。然后,更新后的库会指导后续回合,而在部署期间,Actor 在每个回合都会执行状态条件技能编排。在 GPT-5.5 上,TRACE 将一致性 (Pass^3) 提高了 34.6 分,从 59.9% 提高到 94.5%,同时将潜在性能和可靠性能之间的差距缩小到仅 4.0 分。在官方隐藏集上,TRACE 使用 GPT-5.6-Sol 获得了第一名,获得了 70% 的 Pass^3 分数,比基线相对提高了 40%。这些结果表明 TRACE 将高模型潜力转化为稳定、一致的性能增益。项目主页:https://darwin-agent.github.io/Car-bench-TRACE。