论文

评估大语言模型是否可以可靠地连接 DOT?

Evaluating Whether LLMs Can Reliably Connect the DOTs?

模型评测基准与评测资源

摘要

对现实世界信息的访问通常是嘈杂且碎片化的。从这些片段构建连贯的叙述需要模型在更广泛的故事情节中重建缺失的跨度,通常称为文本填充,同时保持与本地上下文和全球故事情节的一致性。尽管在许多大语言模型(LLM)中使用文本填充作为预训练目标,但它们在现实世界叙事填充上的实际性能仍未得到充分探索。在本文中,我们通过引入约 9.2K 个叙事填充实例的多领域基准来解决这一差距,该基准是通过掩盖四种叙事类型的一到三个句子来构建的:百科全书文本、常识故事、新闻文章和视觉叙事。使用此基准,我们评估了 20 个指令调整的开源 LLM,参数范围从 1.5B 到 70B,涵盖不同级别的指令特异性和推理指导。使用标准自动指标和涵盖五个叙述维度的定性框架评估产出。结果表明,模型规模并不能可靠地预测填充质量:Gemma-2-2B 获得了最高的定性得分 (4.02/5),其性能优于大十倍以上的模型,包括 DeepSeek-Qwen-32B (3.77/5, 6.6%) 和 LLaMA-3.3-70B (3.71/5, 8.3%)。我们进一步发现,显式推理提供的好处有限,因为思路推理仅产生边际改进(+0.6%)。此外,在当前的大语言模型中,简短的叙述和领域特征比单独的填充位置更能预测任务难度。