论文

层级实验师智能体

Hierarchical Experimentalist Agents

智能体系统Agent 环境交互Agent Skills

摘要

大语言模型(LLM)日益被用于在真实世界采取行动并支持人类决策——但多数智能体依赖参数知识、固定后训练数据、检索或搜索。该范式在新域及无法仅凭先验知识回答的复杂查询上失效。例如——知道物理定律本身并不能使LLM在复杂物理系统中回答查询或完成长程任务。为此——我们介绍层级实验师智能体(HExA)——从主动实验中学习的上下文内自改进框架。HExA迭代设计并精化与查询相关的实验——从经验学习可组合技能的可复用库——并整合实验证据以回答查询或采取行动。HExA免训练——兼容任何黑盒模型——不需要外部监督、神谕或离线数据。为评估主动实验——我们介绍Interphyre——建立在PHYRE二维程序化物理环境上的工具调用基准——智能体经仿真API提出干预并检验假设。实验表明当前LLM智能体在这些设定下挣扎——尤其在Interphyre最难层级。Claude Sonnet 4.6仅2%成功——而HExA把同一模型提升到至多77%成功。HExA也改进开放权重模型——并超越ReAct与Reflexion等智能体基线。而且——仅用从较易层级学得、无主动实验迁移的技能——HExA取得44%成功——展示其学得技能的可复用性与泛化性。总体而言——HExA表明经主动实验的学习能帮助智能体发现有用知识、习得可复用技能——并在新颖长程任务上高效推进。

层级实验师智能体:论文配图
图 1:Interphyre 物理难题的 HExA 框架概述。 (a) 基线 ReAct:每个种子都是独立求解的,没有交叉种子学习。每个种子由交替的 Get-State-Info 调用(场景布局、间隙分析)和 Simulate-Action 调用(将红球放置在 (x,y,r)(x,y,r))组成,以成功 (✓) 或失败 (×\times) 终止。 (b) HExA:种子被分组为元剧集。在每个种子之后,进化代理将轨迹提炼成技能库(物理原理+常见错误);进化后的银行被注入到后续种子的系统提示中。 HExA 在每个源级别上运行 25 次迭代,超过 50 个种子,以生成完全进化的特定级别技能库。 (c) 跨级别转移到未见过的级别:每个源级别(down_to_earth、two_body_problem、pass_the_parcel)独立运行(b)中的 HExA 循环(箭头表示这种重用)以构建其技能库。然后,进化者将生成的库合成为单个跨级别技能库,以实现更难的目标级别(弹射器),而无需目标级别轨迹。