论文

LegalCiteTrust:中国长篇法律研究报告中引文可信度的基准测试

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports

模型评测基准与评测资源

摘要

长篇法律研究报告越来越依赖LLM和代理研究系统,但其可靠性不仅取决于对任务的回答,还取决于所引用的法律权威是否值得信赖。即使引用真实来源,也可能存在风险:报告可能会忽略限制条件,错误描述权威,或者用它来支持比来源所允许的更强的主张。我们介绍 LegalCiteTrust,这是一个评估中国长篇法律研究报告引文可信度的基准。它包含 72 个密集注释的报告级任务,并从三个维度评估报告:覆盖范围、支持度和引文可信度。引文可信度通过引文级别的存在性、保真度和适用性 (E/F/A) 来实现。在通用 LLM、深度研究系统和法律专用系统上的实验表明,任务完成、证据丰富度、引用密度和引用可靠性揭示了不同的系统行为。检索工具可以在不可靠地提高信任分数的情况下提高证据支持,而基于 E/F/A 的修订比仅存在的过滤更明显地提高信任和最终分数。这些结果表明,值得信赖的法律研究生成需要检索后的引用感知证据治理:系统不仅必须检索法律权威,而且还必须可靠地选择、描述和应用它们。