论文
层级实验师智能体
Hierarchical Experimentalist Agents
摘要
大语言模型(LLM)日益被用于在真实世界采取行动并支持人类决策——但多数智能体依赖参数知识、固定后训练数据、检索或搜索。该范式在新域及无法仅凭先验知识回答的复杂查询上失效。例如——知道物理定律本身并不能使LLM在复杂物理系统中回答查询或完成长程任务。为此——我们介绍层级实验师智能体(HExA)——从主动实验中学习的上下文内自改进框架。HExA迭代设计并精化与查询相关的实验——从经验学习可组合技能的可复用库——并整合实验证据以回答查询或采取行动。HExA免训练——兼容任何黑盒模型——不需要外部监督、神谕或离线数据。为评估主动实验——我们介绍Interphyre——建立在PHYRE二维程序化物理环境上的工具调用基准——智能体经仿真API提出干预并检验假设。实验表明当前LLM智能体在这些设定下挣扎——尤其在Interphyre最难层级。Claude Sonnet 4.6仅2%成功——而HExA把同一模型提升到至多77%成功。HExA也改进开放权重模型——并超越ReAct与Reflexion等智能体基线。而且——仅用从较易层级学得、无主动实验迁移的技能——HExA取得44%成功——展示其学得技能的可复用性与泛化性。总体而言——HExA表明经主动实验的学习能帮助智能体发现有用知识、习得可复用技能——并在新颖长程任务上高效推进。
