论文
时间抽取任务的多维泛化评测
Evaluating Multi-Dimensional Generalization of Large Language Models in Temporal Extraction Tasks
摘要
时间与事件表达抽取是基础的时间推理任务,但因标注歧义、领域敏感与模型行为不稳定而困难。现有评估聚焦域内性能,对分布偏移下可靠性的洞察有限。我们在泛化的四个维度上评估跨模型族、架构与推理策略的多种配置,考察从基线性能的迁移、跨维相关性以及规模、架构与提示的影响,为提示式LLM在时间表达抽取上的泛化提供系统研究。我们发现:强的基线任务性能通常预测更好的泛化,但在大幅分布偏移下该关系减弱;归纳式提示在域偏移、对抗扰动、组合性与长度增长间表现最一致,而规模、架构与演绎/溯因提示策略的增益不均衡且依赖维度。结论是:LLM在时间抽取任务上的泛化无法由任何单一维度预测,也无法从域内或单维评估可靠推断,需要跨维度泛化的推理策略。