论文

LRAS:基于Agentic搜索的高阶法律推理

LRAS: Advanced Legal Reasoning with Agentic Search

模型训练强化学习Agentic RL

摘要

尽管大型推理模型(LRM)已在数学领域展现出卓越的逻辑能力,但其在法律领域的应用仍受制于程序严谨性与遵循法律逻辑的严格要求。现有法律LLM依赖仅来自内部参数知识的“闭环推理”,常常对自身知识边界缺乏自知,导致自信却错误的结论。为应对这一挑战,我们提出Legal Reasoning with Agentic Search(LRAS),首个推动法律LLM从静态、参数化的“闭环思考”转向动态、交互式“主动询问”(Active Inquiry)的框架。通过融合Introspective Imitation Learning与Difficulty-aware Reinforcement Learning,LRAS使LRM能够识别知识边界并处理法律推理的复杂性。实证结果表明,LRAS超越最先进基线8.2-32%,在需要可靠知识的深度推理任务上增益最大。我们将很快发布数据与模型以供进一步探索。

LRAS:基于Agentic搜索的高阶法律推理
图3:我们所提方法的整体框架。工作流由两个主要阶段组成:阶段1(Introspective Imitation Learning Data Curation,内省模仿学习数据整理),对原始法律数据进行处理、按不确定性过滤,并将其合成为带搜索动作的推理轨迹;阶段2(Difficulty-aware RL Data Curation,难度感知的 RL 数据整理),根据通过率选出困难样本,通过强化学习训练模型。底部面板展示了从 Base Model 到最终 LRAS RL Model 的渐进式训练流程。