论文

潜在递归 LLM 系统的原则性思考

Principled Thoughts for Latent Recursive LLM Systems

模型训练监督微调与指令调优

摘要

大语言模型可以通过在自己的隐藏状态上重复出现或在Agent之间传递这些状态,在连续空间而不是解码的文本中进行推理,而训练仅监督最终解码答案的交叉熵(CE),并且不限制思想。理论和实证分析确立并证实了仅 CE 培训的四种失败,这些失败导致正确答案的可能性较低,例如在不同问题上的思维崩溃和保留不相关的信息。我们引入了 REST(表示监督思想),这是一个训练目标,它将有效思想表示的四个属性(因果性、极小性、可分离性和稳定性)转化为添加到 CE 中的可微损失。我们在潜在的单Agent和多Agent系统中实例化它,无需在推理时更改架构或添加参数。在涵盖数学、科学、医学和代码生成的 7 个基准中,在相同的训练数据、计算和潜在预算的情况下,REST 比仅在Agent设置和模型大小上进行 CE 训练的准确性提高了 7.5 个百分点,最终答案的收敛性提高了 30%。此外,REST 思想编码了获得正确答案所需的更多内容,并且对它们进行解码可以更好地恢复Agent的预期输出,这使得潜在通信更容易解释。项目网址:https://fard-lab.github.io/REST