论文
自提示与跨模型共识使大模型可复现地从科学文献中提取数据
Self-prompting and cross-model consensus enable reproducible data extraction from scientific literature with large language models
摘要
从研究论文中准确提取细致、情境化的数据既费力又耗时。本文研究前沿的基于浏览器的大语言模型(LLM)提取高度情境化信息的表现。我们展示了四种递进的工作流:1)在给定专家精心编写的提示和研究论文时,多数前沿LLM在数据提取上表现良好,但在解读科学语境与细微含义上仍可能吃力;2)在给定简单指令时,LLM能自己撰写提示,其效果几乎与专家撰写的提示相当;3)自主发现研究文献很困难,智能体要么遗漏参考文献,要么产生幻觉引用;4)LLM能依据已发表指南创建与人类专家评委高度一致的新数据集,但仍需要人在回路。综合起来,这些发现界定了一种可审计的分工:专家制定证据标准,模型交叉核对重复提取,研究者裁决有争议的案例,为在不放弃专家监督的情况下扩展科学数据整编提供了一条可行路径。