论文

对探索有用,对精度有风险:评估学术研究中的人工智能工具

Useful for Exploration, Risky for Precision: Evaluating AI Tools in Academic Research

模型评测评测方法与指标

摘要

人工智能 (AI) 工具正在被纳入科学研究工作流程中,有望提高文档分析、问答 (Q&A) 和文献检索等任务的效率。然而,系统输出通常难以验证、生成过程缺乏透明度并且容易出错。需要合适的基准来记录和评估出现的问题。然而,现有的基准测试方法并没有充分捕捉以人为本的标准,例如可用性、可解释性以及与研究工作流程的集成。为了解决这一差距,目前的工作提出并应用了一个结合以人为中心和以计算机为中心的指标的基准测试框架来评估基于人工智能的问答和文献综述工具以供研究使用。研究结果表明,问答工具可以提供有价值的概述和普遍准确的总结;然而,它们对于精确的信息提取并不总是可靠的。可解释的人工智能 (xAI) 准确性特别低,这意味着突出显示的源段落经常无法与生成的答案相对应。这将验证的负担转移回研究人员身上。文献综述工具支持探索性检索,但再现性低、所选来源和数据库的透明度有限、来源质量不一致,使其不适合系统评价。对这些工具组的比较揭示了类似的模式:虽然人工智能工具可以提高研究工作流程和浅层任务的早期阶段的效率,但它们的输出仍然需要人工验证。研究结果强调了可解释性功能对于提高透明度、验证效率以及将人工智能工具仔细集成到研究人员工作流程中的重要性。此外,以人为本的评估仍然是确保实际适用性的一个重要问题。