论文

法律研究平台:衡量长期法律研究机构的端到端可靠性

Legal Research Bench: Measuring End-to-End Reliability in Long-Horizon Legal Research Agents

智能体系统Agent任务评测长程任务评测

摘要

法律研究是一个核心且耗时的法律工作流程。律师必须确定控制机构,验证其仍然有效,协调法规和案例,并综合一个有根据的答案。语言模型Agent非常适合这种检索密集型工作流程,即使部分自动化也很有价值。但这个价值取决于可靠性:一个缺失的权威、陈旧的引用或错误的法律结论都可能使原本看似合理的答案变得无法使用。我们推出 Legal Research Bench (LRB),这是由专家撰写的 413 个开放式美国法律研究问题的基准,每个问题都配有黄金答案、支持权威和二进制评分标准。我们利用网络搜索、判例法搜索、页面解析和检索工具评估了 13 个前沿模型。我们通过源验证的全通评分对Agent响应进行评分,只有满足每个必需的标准并且其引用的权威机构进行验证,响应才是正确的。我们还根据专家律师对大语言模型评审进行验证,确保基准分数跟踪律师的判断。Agent仍然远不可靠:在我们测试的模型中,最强的 Claude Opus 4.8 在 42.9% 的问题上完全正确。绩效也因任务设置的不同而存在很大差异:不同法律领域的全部通过率有所不同,并且在需要冲突当局协调的问题上较低。在模型中,更多的轮次、工具调用和推理成本并不意味着更高的准确性。