论文
LLM在两用计算机模拟生物学任务上对新手的提升
LLM Novice Uplift on Dual-Use, In Silico Biology Tasks
摘要
大语言模型(LLM)在生物学基准上的表现越来越好,但它们是否能提升新手用户——即让人类的表现好于仅使用互联网资源——仍不清楚。这一不确定性对理解科学加速与两用风险都至关重要。我们开展了一项多模型、多基准的人类提升研究,在八个与生物安全相关的任务集上比较拥有LLM访问权限的新手与仅有互联网访问权限的新手。参与者在充裕时间内处理复杂问题(最复杂的任务长达13小时)。我们发现LLM访问带来了显著提升:拥有LLM的新手准确率是对照组的4.16倍(95% CI [2.63, 6.87])。在有专家基线(仅互联网)可用的四个基准中,拥有LLM的新手在其中三个上超过了专家。或许令人意外的是,独立的LLM常常超过LLM辅助的新手,表明用户并未从LLM中引出其最强的可用贡献。大多数参与者(89.6%)报告称,尽管有安全防护措施,获取两用相关信息的难度不大。总体而言,LLM在以往专属于受训从业者的生物学任务上显著提升新手,凸显了在传统基准之外持续开展交互式提升评估的必要性。