论文

超越答案:解码LLM作为科学推理者的行为

Beyond the Answer: Decoding the Behavior of LLMs as Scientific Reasoners

模型评测模型行为与机制分析

摘要

随着大语言模型(LLM)在复杂推理任务上取得日益精细的性能,当前架构为研究前沿模型的内部启发式提供了关键代理。刻画涌现推理对长期的可解释性与安全至关重要。此外,理解提示如何调控这些过程也十分必要,因为自然语言很可能是与AGI系统交互的主要接口。在本工作中,我们使用Genetic Pareto(GEPA)的一个定制变体来系统性地优化面向科学推理任务的提示,并分析提示如何影响推理行为。我们考察GEPA优化提示中固有的结构模式与逻辑启发式,并评估其可迁移性与脆弱性。我们的发现表明,科学推理上的收益往往对应于无法跨系统泛化的模型特定启发式,我们称之为“局部”逻辑。通过将提示优化框定为一种模型可解释性工具,我们主张:为LLM绘制出这些偏好推理结构的图谱,是有效与超人类智能协作的重要前提。

超越答案:解码LLM作为科学推理者的行为:论文配图
图 1:GEPA 建议的提示长度在优化过程中不断增加,最终提示的字符长度通常是初始提示的两倍左右。这表明LLM可能需要详细的提示才能解锁更好的推理能力。