论文

LLM 可以进行时间旅行吗?通过强化学习增强法律代理搜索的时间一致性

Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning

模型训练强化学习

摘要

虽然大语言模型(LLM)增强了代理搜索功能,显示出法律推理的希望,但它们忽视了一个基本限制,即适用的法律必须与每个案件的时间背景相匹配,因为法规的追溯适用违反了核心法律原则并导致错误的结论。我们的观察表明,当前的法律 LLM 存在与其训练截止相关的时间偏差,而搜索代理很少将时间约束纳入查询中,并且仅靠网络搜索无法提供法律推理所需的精确法规和先例引用。为了应对这些挑战,我们提出了 LegalSearch-R1,这是一种端到端的强化学习框架,它将用于精确文章匹配的本地法规 RAG 与用于更广泛法律知识的在线网络搜索相结合,对跨越多个修订期的时间索引数据进行训练,以强制执行时间一致性。对涵盖 13 个法律任务的基准进行的广泛实验表明,我们的 7B 参数代理的性能优于最先进的深度研究框架和专业法律 LLM 12.9% 至 29.8%,在时间一致性上超出基线 57.7% 至 80.3%,并表现出强大的域外泛化能力。代码和数据可在 https://github.com/AlexFanw/LegalSearch-R1 获取。