论文

Trace2Policy:从专家行为踪迹到自演化决策智能体

Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents

智能体系统Agent Harness

摘要

企业专家在审计、合规性和合同审查中默认应用的决策规则可以通过迭代错误分析来系统地恢复和改进。我们提出了 \textbf{Trace2Policy},其核心机制 - \textbf{EISR} (\textbf{E}rror-driven \textbf{I}terative \textbf{S}kill \textbf{R}efinement) - 维护一个人类可读的规则文档作为其优化目标:每轮在验证集上执行规则,根据根本原因将错误聚类为缺失、错误或冲突类型,应用有针对性的补丁,以及仅提交那些通过回归门的内容。 \textbf{对于此类合规性敏感、倾斜基本速率的决策任务,我们将规则质量(而不是模型能力)确定为主要性能杠杆}:在五个 LLM 中,部署池上的一次性蒸馏平台接近 $\sim$70\%,而当编译成确定性 Python 时,八个 EISR 轮将相同的规则提升到 79.6\% - 推理时的 LLM 调用为零。 \textbf{执行形式会带来收益:在生产中,相同的 EISR 精炼内容在编译后的 Python 中运行比在 LLM 提示中运行高 9.8~pp,LLM 是一个表单和工程捆绑包,经过 22 天的部署而成熟。} 在一家主要物流公司部署了 22 天(3,349 个审计案例),编译后的管道优于它所取代的纯 LLM 基线(72.7\%);在这些校准的、倾斜的基本速率工作负载上,重新启用 LLM 回退会单调降低准确性。 LLM 驱动的变体,\textbf{Auto-EISR},以每周期 5--10 美元(相对于 70 美元\sim$70 专家小时)的速度再现了这种改进,并且无需重新设计即可转移到涵盖法律推理 (LegalBench) 和流程挖掘决策 (BPIC 2012) 的四个公共基准。