论文

长期法律推理 Agent 的推理时经验演化

Test-Time Agent Evolution for Long-Horizon Legal Reasoning

上下文与知识智能体系统记忆Agent SkillsAgent记忆

摘要

法律情报旨在支持涉及不断变化的案件状态和多重角色的长期法律流程中的可靠决策。然而,现实世界的法律部署在事实、证据和程序背景方面表现出巨大的案件异质性,暴露了静态智能体策略的局限性。此外,法律推理本质上是跨角色和程序阶段相互依赖的,这使得全局可靠性与孤立的角色能力有着根本的不同。为了应对这些挑战,我们研究了 无需训练测试时智能体 适应,其中智能体不断利用来自先前案例和正在进行的交互的部署时信号,而无需更新模型参数。我们提出本文方法,引入测试时记忆 Evolution来从以前的案例中检索可重用的经验,使其适应当前的事实和程序背景,并为后续决策巩固积累的经验。此外,Rubric-Aligned Collaboration 根据行为和程序要求验证和修改特定于角色的操作,从而实现跨角色和阶段的协调决策。在 J1-EVAL 和 LegalWorld 上跨五个 骨干模型 模型进行的广泛实验表明,在合理的交互和计算成本下,代表性推理和智能体基线得到了一致的改进。 消融和案例研究进一步表明,这两个组件在经验适应和跨角色协调方面提供了互补的优势,提高了长期法律推理的可靠性和效率。

长期法律推理 Agent 的推理时经验演化:论文原图
图2. TALA总体框架。在连续的测试时设置下,智能体按顺序与不断发展的法律案例交互,并利用部署时信号,而无需更新模型参数。 TALA 由两个组件组成:测试时记忆 Evolution 和 Rubric-Aligned Collaboration,它们使先前的经验适应当前的案例,并调整特定于角色的行为以改进后续决策。