论文
更多上下文总是更好吗?考察 LLM 在时间间隔预测上的推理能力
Is More Context Always Better? Examining LLM Reasoning Capability for Time Interval Prediction
摘要
大语言模型(LLM)已在不同领域展现出令人印象深刻的推理与预测能力。然而,它们从结构化行为数据中推断时间规律的能力仍未被充分探索。本文开展一项系统性研究,考察 LLM 能否预测重复性用户动作之间的时间间隔(如重复购买),以及不同层级的上下文信息如何塑造其预测行为。我们以一个简单但具代表性的复购场景,将最先进的 LLM 在零样本设定下与统计模型及机器学习模型进行基准比较。研究得到两个关键发现。其一,尽管 LLM 超过轻量统计基线,但始终不及专用机器学习模型,表明其捕捉定量时间结构的能力有限。其二,适度上下文可以提升 LLM 准确率,而继续增加用户级细节会使性能退化。这些结果挑战了“更多上下文带来更好推理”的假设。我们的研究凸显了当今 LLM 在结构化时间推断上的根本局限,并为设计融合统计精度与语言灵活性的未来上下文感知混合模型提供了指导。
