论文

LongSocialBench:长上下文 LLM 能否理解在线讨论线程?

LongSocialBench: Do Long-Context LLMs Understand Online Discussion Threads?

模型评测基准与评测资源

摘要

长上下文 LLM 现在可以摄取整个在线讨论线程,但理解他们的社交话语需要的不仅仅是阅读长文档:模型必须跟踪父回复关系、转折点、范围子树、跨分支对比和参与者轨迹。为了测试这种结构感知的社交推理,我们引入了 LongSocialBench,这是一个由 1,462 个经过验证的人类创作的多项选择项目组成的基准,这些项目选自 94 个完整的 Hacker News、Stack Exchange 和 Reddit r/ChangeMyView 剧集,中位长度约为 73K token。每个项目都将完整的序列化讨论和回复结构与四个选项的问题配对,要求模型恢复结构化的社会证据。已发布的项目经过可回答性、选项唯一性和证据基础的验证。在 18 个模型和 29 个评估设置中,当前的长上下文工作流程仍然远远低于人类表现。最好的个人结果来自 Claude-Opus-4.7,当提示在回答之前消除不正确的选项时,该结果达到 63.0%,而独立人类读者的结果为 72.4%。对所有 18 个模型进行平均,全上下文基线得分为 43.9%。提供标准证据片段将其提高到 55.0%,表明即使在识别相关线程区域后,仍然存在重大错误。 LongSocialBench 表明,缺失的功能不仅仅是上下文访问或提示,而是对结构化回复树的社交理解。

LongSocialBench:长上下文 LLM 能否理解在线讨论线程?的原论文方法或结果图
图 1:LongSocialBench 构建和 验证 管道(§3.1)。我们对长时间的公开讨论进行抽样,根据能力定义编写项目,应用反捷径控制,独立验证答案和证据,并裁决剩余争议。