论文
检查点还不够:CoSLR 中的信任校准,这是一种用于系统文献综述的人类人工智能系统
Checkpoints Are Not Enough: Trust Calibration in CoSLR, a Human-AI System for Systematic Literature Reviews
摘要
系统文献综述 (SLR) 对于循证研究至关重要,但仍然非常耗时,需要研究人员在规划、筛选、分析和报告过程中管理大量出版物。大型语言模型 (LLM) 现在可以生成流畅、结构良好的评论文本,这使得很难区分经过研究人员验证的综合和仅仅看起来具有权威性的综合。这增加了未经验证的人工智能生成的合成进入学术记录并具有系统评价可信度的风险。我们提出了 CoSLR,一种人类与人工智能协作的多智能体系统,它通过使用大型语言模型和检索增强生成(RAG)的模块化三相管道来支持 SLR 工作流程,并在生成输出和接受之间的路径上放置明确的、强制性的人工检查点。在一项有 63 名参与者参与的调查研究中,该系统获得了积极评价:63 名参与者中的 27 名(42.9%)对其可用性评价很高,这表明强制性检查点并没有以牺牲可用界面为代价。然而,只有当研究人员使用检查点进行验证时,检查点才能保障审查:63 名参与者中的 22 名 (34.9%) 表示,在与系统进行短暂交互后,他们将信任人工智能生成的摘要和报告,而无需额外的人工检查。这些发现表明,人机协作可以支持文献综述工作,但人类监督的有效性取决于用户是否愿意行使。这是接口设计必须直接解决而不是假设的校准问题。