论文
动态技能:LLM 代理的测试时自适应技能综合
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
摘要
额外的测试时计算可以让 LLM 代理获得更多过去的经验,但扩展上下文或添加部署并不一定会产生更大的代理能力。我们将此挑战称为测试时计算到能力的转换,并提出 SkillTTA,它检索与任务相关的训练轨迹,并根据具有固定参数的求解器的可见目标上下文合成临时技能。为了追求更高的性能上限,SkillTTA 进一步使用元提示优化(MPO)来适应写入这些技能的策略。 MPO 评估候选人对配对任务的提示,并强调信息转换。它还将更新限制在特定于基准测试的原子槽中,从而减少了仅通过技能合成和求解器采样轨迹间接观察每个编辑所造成的差异。在 ALFWorld、SpreadsheetBench、BigCodeBench 和 WebShop 中,SkillTTA 的性能优于最先进的重用和优化基准。与基线重用和采样策略相比,它以更低的计算成本获得了更高的性能上限。