论文
从智能体踪迹中归纳推理原语
Inducing Reasoning Primitives from Agent Traces
摘要
ReAct 风格的 LLM 代理通常会重新发现问题中的相同推理例程,但会将这些例程困在暂时的草稿本中。我们引入了 Reasoning Primitive Induction,这是一种单遍方法,可以挖掘成功的 ReAct 痕迹,对循环推理动作进行聚类,并将最频繁的动作转换为紧凑的类型化伪工具库。每个伪工具都由 LLM 在调用时解释的自然语言文档字符串指定,并且标准 ReAct 循环在测试时组成这些原语。核心结果是,诱导库的性能优于生成其痕迹的代理:在 RuleArena NBA 上提高了 44 个百分点(30 -> 74),在 MuSR 团队分配上提高了 30 个百分点(38 -> 68),在 NatPlan 会议计划上提高了 22 个百分点(7 -> 29)。在涵盖叙述推导、规则应用和约束满足规划的五个可比较的子任务中,单个固定配置在每个子任务上都比零样本思想链有所改进,匹配或超越了专家编写的分解,并以较低的平均推理成本优于 AWM。