论文
CANDI:利基领域问答的上下文对齐
CANDI: Contextual Alignment for Niche Domains Question Answering
摘要
在医疗诊断和财务咨询等专业领域部署 大语言模型 (LLM) 需要评估超出一般知识的能力。传统的问答基准通常无法捕捉这些领域所需的细致入微的上下文依据、用户意识和领域理解。为了解决这个问题,我们引入了 CANDI-QA(利基领域问答的上下文对齐),这是一个新颖的数据集,用于评估 LLM 在专门设置中提供准确、上下文敏感和用户对齐的答案。 CANDI-QA 具有专家策划的问答对,分为两类:(1) 信息辅助问题,这是需要精确提取的直接事实查询;(2) 应用推理问题,这是需要情境推理以生成可行见解的多跳推理任务。我们评估了十多种不同的语言模型,从紧凑的开源系统到最先进的专有系统。作为强大的基线,我们提出了 MTSS-Net,这是一种将神经检索与基于规则的推理相结合的轻量级神经符号框架。我们的研究结果强调了在利基领域实现上下文对齐所面临的深刻挑战,揭示了当前 LLM 在没有增强上下文或符号集成的情况下的局限性。最终,CANDI-QA 成为推进上下文感知语言模型研究的关键基准,刺激高风险领域强大、值得信赖的人工智能的开发。