论文

哪些模型在继承推理中表现更好?

Which Models Perform Better in Inheritance Reasoning?

模型评测模型能力评测

摘要

本文介绍了 PSL 团队参与 QIAS 2026 阿拉伯伊斯兰继承推理共享任务的情况。该任务评估大语言模型解决需要法律解释、多步推理和精确数值计算的继承案件的能力。我们在统一的提示策略下比较 \textit{commercial} 和 \textit{open-source} 模型,以评估它们在结构化法律推理中的有效性,并尽可能减少特定任务的适应。 \\ 我们的结果显示两个模型系列之间的可靠性存在明显差距。商业模型在识别合格继承人、应用排除规则以及保持推理步骤的一致性方面表现出更强的性能。相比之下,开源模型表现出更大的不稳定性,特别是在涉及相关法律决策和部分份额调整的情况下。 \textit{Gemini 2.5 Flash} 实现了最佳性能,MRE 为 $0.989$。