论文

自我提示:LLM 能否从体验抽象中受益?

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

摘要

人类将经验提炼成可重用的抽象概念,例如策略和警告提醒,并应用它们来逐步更有效地解决问题。我们研究 大语言模型 (LLM) 是否可以同样从这种经验抽象中受益。从 LLM 的解决方案跟踪数学训练集,更强大的老师或 LLM 本身将自然语言抽象提取到可检索的库中。我们探索两种使用模式:(1) 推理时间检索和 (2) 具有抽象增强训练提示的强化学习 (RL)。经验抽象提高了 LLM 在数学和逻辑推理基准上的性能。自提取的抽象与教师提取的抽象相匹配,并且我们的抽象使用框架可以转移到其他数据集和模型。这些发现表明 LLM 可以提取和应用经验抽象,就像人类利用蒸馏经验一样。