论文

超越事实:大语言模型 中的分布式阅读理解基准测试

Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models

模型评测基准与评测资源

摘要

虽然 LLM 的大多数阅读理解基准都侧重于可以通过本地化特定文本证据来回答的事实信息,但许多现实世界的任务需要理解分布信息,例如人口水平趋势和跨文本集合表达的偏好。我们引入了 Text2DistBench,这是一个阅读理解基准,用于评估 LLM 从自然语言推断分布知识的能力。该基准测试以现实世界中有关电影和音乐实体的 YouTube 评论为基础,提供了具有实体元数据和相关评论的模型,并要求它们回答分布问题,例如估计正面和负面评论的比例,或识别观众中讨论最频繁和第二频繁的主题。为了支持可靠和长期的评估,Text2DistBench 的构建管道是完全自动化的,并随着时间的推移不断更新以纳入新出现的实体。多个 LLM 的实验表明,虽然模型的性能大大优于随机基线,但不同分布类型和特征的性能差异很大。这些发现突出了当前 LLM 在分布式阅读理解方面的能力和局限性,并证明了 Text2DistBench 作为未来研究的实用且可扩展的测试平台的价值。