论文

从噪声到多样性:LLM推理中的随机嵌入注入

From Noise to Diversity: Random Embedding Injection in LLM Reasoning

上下文与知识模型训练强化学习上下文工程RLVR

摘要

近来的软提示研究尝试通过向LLM输入插入训练得到的向量来改进推理,但增益究竟来自所学内容还是来自注入行为本身,尚未被仔细区分。我们研究随机软提示(RSP),它完全省去训练步骤,直接在输入后附加一段新抽取的随机嵌入向量序列。每个RSP向量从按预训练嵌入表逐元素均值与方差拟合的各向同性高斯分布中采样;该序列不携带任何习得内容,却在多种设置下于数学推理基准上达到与优化软提示相当的准确率。其机制分两个阶段展开:由于注意力必须吸收一个从未见过的随机位置,最初几个生成token上的分布被拉平、推理轨迹发生分叉;随着生成继续,这一影响自然稀释,回复最终收敛到单一补全。我们表明,在推理阶段RSP提升早期token多样性,并与温度采样结合扩大Pass@N,即N次尝试中至少一次正确的概率。超越推理,我们将同样的效应引入DAPO训练并展示了实际收益。我们的贡献是:(i) RSP分离出软提示的最简形式——免训练、随时重采样——为各种在训练与形式上不同的变体共同分享的注入结构性效应提供了统一视角;(ii) 对底层机制进行理论与实证验证;(iii) 将该效应从推理扩展到训练。

从噪声到多样性:LLM推理中的随机嵌入注入:论文配图
图 2:Qwen2.5-Math-7B 上的每个令牌注意力质量(后缀,500 个 MATH-500 问题,每个问题独立的 RSP)。 (a) RSP-token 注意力沿着推理位置轴减少,匹配定理 1 的 KV 缓存增长界限;额外的层轴减少是定理 1 范围之外的一种经验现象(更深的层会加剧真实与随机的差距)。 (b) 问题标记的注意力保持相对一致。报告数量:附录 F 的每个token质量,等于 wr,i(ℓ)/Lw_{r,i}^{(\ell)}/L 在头数和样本上的平均值。