论文

适配接口而非模型:确定性LLM智能体的运行时框架自适应

Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents

智能体系统Agent HarnessAgent Skills

摘要

LLM 智能体不仅由其语言模型决定,还受到协调观察、工具使用、动作执行、反馈解释和轨迹控制的运行时控制的影响。虽然现有的代理适应方法主要更新模型参数,但确定性的、规则管理的领域中的许多失败源于模型-环境接口的不匹配。我们提出了 Life-Harness,这是一种生命周期感知的运行时工具,可以在不改变模型权重或评估环境的情况下改进冻结的 LLM 代理。生命线束从训练轨迹演变而来,将反复出现的交互失败转化为跨环境契约、程序技能、行动实现和轨迹调节的可重复使用的干预措施,并在持续评估期间保持固定。在 $\tau$-bench、$\tau^2$-bench 和 AgentBench 的 7 个确定性环境中,Life-Harness 改进了 18 个模型主干的 126 个模型环境设置中的 116 个,平均相对改进为 88.5%。 Harnesses 仅从 Qwen3-4B-Instruct 轨迹转移到其他 17 个模型,这表明 Life-Harness 捕获可重用的环境侧结构而不是模型特定的行为。这些结果将运行时接口适应定位为以模型为中心的代理训练的补充替代方案。代码可在 GitHub 上获取。

适配接口而非模型:确定性LLM智能体的运行时框架自适应
图 1:调整运行时工具,而不是模型。 Life-Harness 保持 LLM 权重固定,并根据训练轨迹发展可重用的界面干预,在代理任务、基准测试和模型骨干方面产生广泛而实质性的收益。