论文
LongSocialBench:长上下文 LLM 能否理解在线讨论线程?
LongSocialBench: Do Long-Context LLMs Understand Online Discussion Threads?
摘要
长上下文 LLM 现在可以摄取整个在线讨论线程,但理解他们的社交话语需要的不仅仅是阅读长文档:模型必须跟踪父回复关系、转折点、范围子树、跨分支对比和参与者轨迹。为了测试这种结构感知的社交推理,我们引入了 LongSocialBench,这是一个由 1,462 个经过验证的人类创作的多项选择项目组成的基准,这些项目选自 94 个完整的 Hacker News、Stack Exchange 和 Reddit r/ChangeMyView 剧集,中位长度约为 73K token。每个项目都将完整的序列化讨论和回复结构与四个选项的问题配对,要求模型恢复结构化的社会证据。已发布的项目经过可回答性、选项唯一性和证据基础的验证。在 18 个模型和 29 个评估设置中,当前的长上下文工作流程仍然远远低于人类表现。最好的个人结果来自 Claude-Opus-4.7,当提示在回答之前消除不正确的选项时,该结果达到 63.0%,而独立人类读者的结果为 72.4%。对所有 18 个模型进行平均,全上下文基线得分为 43.9%。提供标准证据片段将其提高到 55.0%,表明即使在识别相关线程区域后,仍然存在重大错误。 LongSocialBench 表明,缺失的功能不仅仅是上下文访问或提示,而是对结构化回复树的社交理解。
