论文
LLM 的数据参数对应关系:初步讨论
Towards a Data-Parameter Correspondence for LLMs: A Preliminary Discussion
摘要
大语言模型 优化历史上分为以数据为中心和以模型为中心的孤立范式:前者通过选择、增强或中毒来操纵涉及的样本,而后者通过掩蔽、量化或低秩适应来调整模型权重。本文建立了一个统一的\emph{数据参数对应关系},将这些看似不同的操作揭示为统计流形$\mathcal{M}$上相同几何结构的双重表现。基于 Fisher-Rao 度量 $g_{ij}(θ)$ 以及自然参数 ($θ$) 和期望参数 ($η$) 之间的勒让德对偶性,我们确定了跨越模型生命周期的三个基本对应关系: 1. 几何对应关系:数据修剪和参数稀疏化通过双坐标约束等效地减少了流形体积; 2. 低秩对应:上下文学习(ICL)和 LoRA 适应在 Grassmannian $\mathcal{G}(r,d)$ 上探索相同的子空间,$k$-shot 样本在几何上等同于rank-$r$ 更新; 3.安全-隐私对应:对抗性攻击表现出数据中毒和参数后门之间的协同放大,而保护机制遵循级联衰减,其中数据压缩成倍地增强参数隐私。该框架从通过 后训练 压缩进行的训练扩展到推理,为跨社区方法转移提供了数学形式化,证明集成数据和参数模式的协作优化可能在效率、鲁棒性和隐私维度上优于孤立的方法。