论文
MedConclusion:从结构化摘要生成生物医学结论的基准
MedConclusion: A Benchmark for Biomedical Conclusion Generation from Structured Abstracts
摘要
大语言模型 (LLM) 被广泛用于推理密集型研究任务,但用于测试它们是否可以从结构化生物医学证据推断科学结论的资源仍然有限。我们引入 $\textbf{MedConclusion}$,这是一个用于生成生物医学结论的 $\textbf{5.7M}$ PubMed 结构化摘要的大规模数据集。每个实例将摘要的非结论部分与原作者撰写的结论配对,为证据到结论的推理提供自然发生的监督。 MedConclusion 还包括生物医学类别和 SJR 等期刊级元数据,支持跨生物医学领域的亚组分析。作为初步研究,我们在结论和摘要提示设置下评估不同的 LLM,并使用基于参考的指标和 LLM 作为法官对输出进行评分。我们发现结论写作在行为上与摘要写作不同,强大的模型在当前自动指标下仍然紧密聚集,并且判断身份可以显着改变绝对分数。 MedConclusion 提供了可重复使用的数据资源,用于研究从科学证据到结论的推理。我们的代码和数据可在以下网址获取:https://github.com/Harvard-AI-and-Robotics-Lab/MedConclusion。