论文

神经符号LoRA:为何以及何时调权重、何时改写提示

Neurosymbolic LoRA: Why and When to Tune Weights vs. Rewrite Prompts

模型训练参数高效训练

摘要

大语言模型(LLM)既可以通过改变模型参数的数值更新来适配,也可以通过作用于离散提示或逻辑约束的符号操作来适配。数值微调擅长注入新的事实知识,而符号更新无需重训练即可灵活控制风格与对齐。我们提出神经符号 LoRA 框架,动态组合这两种互补策略。具体而言,我们给出统一的监测信号和一个基于奖励的分类器,用于决定何时使用 LoRA 进行更深入的事实重建、何时应用 TextGrad 进行词元级编辑。我们的方法只在需要时才把符号变换卸载到外部 LLM,因此保持内存高效。此外,符号编辑过程中产生的精炼提示可作为高质量、可复用的训练数据,这在数学推理等数据稀缺领域是重要收益。跨多个 LLM 主干的广泛实验表明,神经符号 LoRA 持续优于纯数值或纯符号基线,展现出更强的适应性与更好的性能。我们的发现凸显了交替进行数值与符号更新、把语言模型微调推向新一层通用性的价值。

神经符号LoRA:为何以及何时调权重、何时改写提示
图1:神经符号 LoRA 框架概览:我们以可视化方式描绘了该框架的工作流程。具体而言,有两种在数值更新与符号更新之间交替的主要方式:一是利用训练信号的选择准则,二是使用基于奖励的分类器。