论文
TTHE:测试时安全带的演变
TTHE: Test-Time Harness Evolution
摘要
LLM 代理的行为不仅由底层模型决定,还由其工具决定:构建上下文、调用工具、验证中间结果以及从故障中恢复的可执行程序。现有方法在部署之前优化此类工具,搜索固定代理工作流程的训练或开发数据,然后在测试时冻结该工作流程。当测试分布、故障模式或工具交互与开发过程中看到的不同时,这会限制适应性。我们询问是否可以在评估本身期间优化工具,仅使用代理在测试输入上生成的未标记执行跟踪。我们引入了测试时工具演化(TTHE),它将可执行工具视为测试时适应的状态。在评估过程中,TTHE 维护了一批候选工具,并通过代理提议者对它们进行提炼,该代理提议者对它们的执行轨迹进行推理,无需标准标签或特定于任务的监督;然后,法官根据执行衍生的代理信号提交改进的控制,并且所选程序将持续控制后续输入。至关重要的是,TTHE 不会更新模型权重,不需要标准标签,也不会训练单独的适应模型:求解器、提议者和判断者是不同的角色,并且围绕同一个冻结的 LLM 进行控制,因此所有适应都是通过更改周围程序来发生的。在文本到 SQL、竞争性编程、软件工程、数据科学编码和代理工具使用任务中,TTHE 改进了固定的 ReAct 式基线工具,产生持久的、可检查的改进,而不是预先搜索的工作流程或每次查询重试。这些结果将 LLM 代理的测试时适应重新定义为可执行控制程序的演变,并将执行衍生的代理可靠性确定为稳健的无监督代理改进的核心挑战。