论文

R-APS:面向约束推理的组合推理与上下文元学习

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

智能体系统上下文与知识记忆Agent 规划Agent记忆

摘要

大型语言模型 (LLM) 能够流畅地执行开放式任务,但在代理环境中,系统必须在更广阔的范围内进行规划、使用工具和行动,流畅性并不能确保可靠的交付。我们将这种差距追溯到三个耦合的结构故障:错误在没有本地化的情况下传播,最坏情况的扰动未被评估,积累的知识永远不会失效。我们认为这些都有一个根本原因:溯因推理、反事实推理、元归纳推理、纠正推理和归纳推理将共同的背景推向不相容的方向。我们引入了反射性对抗帕累托搜索(R-APS),据我们所知,这是第一种通过推理模式分解联合解决所有三种失败的方法,为每种推理模式分配自己的上下文并协调三个时间尺度的交互:使用类型化验证批评家的分阶段组合推理(失败定位),敏感度引导的反事实压力测试作为一流的帕累托目标(鲁棒性),以及具有显式失效的元归纳规则提取(持久性)。记忆)。 R-APS 不需要微调,并且纯粹通过结构化协议设计在冻结的 LLM 上运行。我们评估平面机构综合(机器人、假肢、机械设计),每个候选者都由运动学解算器检查。在 32 个目标轨迹上,R-APS 提供的鲁棒性证书比均匀扰动基线严格 3.5 倍,首次接纳迭代速度提高 46%,倒角距离比 Enum+GA 减少 2.1 倍,同时共同控制条数和最坏情况鲁棒性。事实证明,小型 4B 推理专用模型与协议内的通用 70B 主干网具有竞争力,这表明结构化协议可以部分抵消模型规模。

R-APS:面向约束推理的组合推理与上下文元学习:论文配图
图 2:R-APS:三时间尺度推理模式分离。左(红色):每个时间尺度解决的三个结构性故障。模式 1(阶段内)将设计分解为带有类型化验证批评器 C1/C2/C3 的类型化阶段;选择性细化仅校正诊断的阶段 (i)。插图链接显示阶段内进展:左侧,原始拓扑建议(不受约束的几何形状,无目标);右图,优化后的相同机制,耦合器轨迹(红色虚线椭圆)与目标对齐。模式 2(情节内)运行 Sobol 导向的压力测试,提供消除故障 (ii) 的鲁棒性证书 ρ⁡(M)\rho(M)。模式 3(情节间)从细化轨迹中提取启发式并使之无效;紫色虚线循环在没有参数更新的情况下提供 π(t+1)\pi^{(t{+}1)} ,消除了失败 (iii)。