论文
STRIVE:探索分级合理性生成和评估中的推理极限
STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation
摘要
事件知识涉及谁对谁做了什么。心理语言学家使用事件合理性判断来研究这些知识如何支持人类语言处理。为了隔离合理性效应,这些研究需要受控事件集,其中一个事件槽在不同合理性水平之间变化,而所有其他事件特征保持固定。手动构建此类集合是劳动密集型的。因此,我们引入了 STRIVE,一个基于 LLM 的框架,用于联合生成和评估跨合理性类别(合理与不合理)和预期分类难度(简单与困难)的受控事件集。给定一个动词,STRIVE 构造一个共享事件框架,然后通过改变一个插槽同时保持所有其他插槽固定,为每个条件生成一个事件。在使用 60 个动词的 6 个模型进行的实验中,使用基线生成提示,GPT-5.1 仅在 16.7% 的时间内生成了高质量的集合。添加全局推理暂存器和评估者引导的细化将这一比率提高到 75.0%。更大的推理努力也提高了评估者——人类的一致性。然而,接近合理边界的事件仍然是最困难的。它们引起了人类最大的分歧,并且最好的评估者在难以置信的困难条件下只能达到 57% 的准确率,这表明需要人类输入。总体而言,STRIVE 提供了一种可扩展的方法,通过自动生成心理语言学研究的初始事件集和评估来减少手动工作。