论文
WildSEEK:评估信息搜索的语言模型
WildSEEK: Evaluating Language Models for Information-Seeking
摘要
语言模型越来越多地中介最终用户的信息访问,敦促对他们的反应进行系统评估,以建立公平可靠的信息生态系统。然而,现有的评估通常是针对特定主题的或综合的,限制了它们捕获“野外”信息搜索查询的复杂性以及模型响应中存在的风险的能力。为了解决这一差距,我们引入了 WildSEEK,这是一个手动注释的数据集,包含来自真实用户交互的 3k 信息搜索查询,以及 LLM 生成的响应的评估框架。 WildSEEK 包括风险敏感领域(例如健康和财务信息)的注释,并将事实查询与寻求事实之外的响应的分析查询区分开来。我们在 WildSEEK 上训练分类器来分析超过 180 万个实际用户查询。我们发现,超过三分之一的信息检索查询是高风险的,而且更多的是分析性的。我们的研究结果表明,LLM 响应在四个标准上更容易失败:阿谀奉承行为、过度依赖、默认的以美国为中心的观点以及对弱势群体的处理不当——分析查询的失败率大多更高。通过提供监控 LLM 行为的可靠性、安全性和公平性的方法,我们的数据集和评估框架为这些系统在信息访问中扮演越来越重要的角色时应如何表现这一更广泛的问题提供了经验基础。