论文
用于模拟评估的多语言和与领域无关的舌尖查询生成
Multilingual and Domain-Agnostic Tip-of-the-Tongue Query Generation for Simulated Evaluation
摘要
舌尖 (ToT) 检索基准主要集中在英语上,限制了它们对多语言信息访问的适用性。在这项工作中,我们使用基于 LLM 的查询模拟框架构建了中文、日语、韩语和英语的多语言 ToT 测试集合。我们系统地研究提示语言和源文档语言如何影响模拟 ToT 查询的保真度,通过系统排名与真实用户查询的相关性来验证合成查询。我们的结果表明,有效的 ToT 模拟需要语言感知的设计选择:非英语语言源通常很重要,而当非英语源为查询生成提供的信息不足时,英语维基百科可能会很有用。基于这些发现,我们发布了四个 ToT 测试集合,其中每种语言跨多个领域包含 5,000 个查询。这项工作提供了第一个大规模多语言 ToT 基准,并为构建英语以外的真实 ToT 数据集提供了实用指导。