论文

知识合成审查框架:基于 LLM 的多源证据合成系统的任务级基准测试

Knowledge Synthesis Review Framework: Task-Level Benchmarking of LLM-Based Systems for Multi-Source Evidence Synthesis

模型评测评测方法与指标

摘要

快速发展领域的证据分散在学术研究、行业报告、政策文件和媒体来源中,质量、结构和目的各不相同,使得及时综合变得困难。 大语言模型 (LLM) 可能会加速这项工作,但它们在复习的不同认知任务中的可靠性仍然不确定。我们引入了知识综合审查(KSR),这是一个人机交互框架,它将证据综合分解为筛选、提取、分析和综合,根据专家参考标准对每项任务上基于 LLM 的系统进行基准测试,并在持续的专家验证下将每项任务路由到性能最佳的系统。我们根据评估者间高可靠性的金标准(92.2% 一致性,kappa = 0.80),在来自 1,893 个 AI 文档语料库和跨越四种源类型的工作的 244 个文档基准子集上评估了 GPT-5、Claude Sonnet 4、Gemini 2.5 Pro 和 NotebookLM。没有一个系统可以主导所有任务。 Claude Sonnet 4 实现了最高的筛选准确率 (82.8%),GPT-5 实现了最高的召回率 (91.8%),但牺牲了较低的特异性。标题和来源的提取一致性超过 90%,但作者和参考文献字段的一致性下降。解释性分析和跨源综合的性能下降最多,而专家判断仍然至关重要。对截止后文件的污染检查显示,没有证据表明之前的接触夸大了结果。应用于完整的语料库时,路由工作流程暴露了单源合成会忽略的跨源不对称性和盲点,包括工人福祉、小公司和全球南方。 KSR 提供​​了一个透明、可审计、与模型无关的框架,用于管理研究综合中的 LLM 援助,同时保留人类责任。