论文

通过 RAG 助手寻求信息:模型大小在人类与人工智能的协作中重要吗?

Seeking Information with RAG-Assistants: Does Model Size Matter in Human-AI Collaborations?

模型评测模型能力评测

摘要

对 LLM 的许多研究都集中在提高基准性能上。然而,在现实世界的人类与人工智能协作工作流程中对此类模型的评估仍然落后。这项工作在现实的多轮信息搜索场景中评估基于检索增强生成(RAG)的聊天机器人式助手,其灵感来自于工作场所环境,其中遵守当地立法和安全处理敏感数据通常是关键。具体来说,我们检查了 RAG 助手协助下的人类 (N=112) 与仅 LLM 或 LLM+RAG 基线相比的表现。在这种情况下,我们研究了底层模型大小(3B、8B 和 70B)如何塑造人类与人工智能的协作动态以及它如何影响感知的可用性和满意度。结果表明,无论模型大小如何,人类与人工智能协作相对于仅模型基线的性能增益都是显着的,这表明混合系统在信息搜索场景中是有益的。然而有趣的是,参与者感知的可用性和满意度在不同模型大小之间几乎没有差异。这表明模型大小、性能和用户感知之间存在微妙的权衡。我们的工作强调了在与人类用户的实际多轮交互中评估人工智能应用程序的附加值,除了准确性之外还关注可用性和满意度,而不是只关注基准性能。