论文

AI在LSAT中取得满分

AI Achieves a Perfect LSAT Score

模型评测模型能力评测

摘要

本文报告了首个有记载的语言模型在官方公开的法学院入学考试(LSAT)中取得满分的实例。对八个推理模型的受控实验表明,改变提示、打乱选项顺序与多次采样作为性能驱动因素没有实质影响。然而,消融模型在作答前生成的思考阶段会使前沿模型准确率最多下降8个百分点,且主要发生在逻辑推理部分。蒸馏模型以相同格式生成完整的思考轨迹,但其性能远低于前沿模型即趋于停滞。一个通过QLoRA在官方LSAT解析上微调的试点过程奖励模型借助Best-of-5选择缩小了这一差距,增益同样主要体现在逻辑推理上。自1948年以来一直充当精英法学教育守门人的LSAT,不仅被通过,而且被会推理的模型零错误作答。它所测试的认知能力上限不再为人类认知所独有。