论文
基于稀疏自编码器引导的可控 LLM 推理
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
摘要
大推理模型(LRM)在推理过程中表现出类似人类的认知推理策略(例如回溯、交叉验证),从而提高了其在复杂任务上的性能。目前,推理策略是由 LRM 自己自主选择的。然而,这种自主选择常常会产生低效甚至错误的推理路径。为了使推理更加可靠和灵活,开发控制推理策略的方法非常重要。由于 LRM 隐藏状态中的概念纠缠,现有方法难以控制细粒度推理策略。为了解决这个问题,我们利用稀疏自编码器(SAE)将策略纠缠的隐藏状态分解为解纠缠的特征空间。为了从大量 SAE 特征中识别少数特定于策略的特征,我们提出了 SAE-Steering,这是一种高效的两阶段特征识别管道。 SAE-Steering 首先召回放大特定策略关键字的 logits 的特征,过滤掉超过 99% 的特征,然后根据控制有效性对剩余特征进行排名。使用识别的策略特定特征作为控制向量,SAE-Steering 在控制有效性方面优于现有方法 15% 以上。此外,控制推理策略可以将 LRM 从错误路径重定向到正确路径,实现 7% 的绝对精度提升。
