论文

超越纯推理部署:基于权重的知识固化与级联压缩的对比

Beyond Inference-Only Deployment: Comparing Weight-Based Consolidation Against Cascading Compaction

模型训练持续学习

摘要

主流LLM平台以纯推理配置部署模型:模型响应请求,但从不更新按用户的权重。用户必须反复重新教授偏好、修正与项目上下文,而基于上下文的变通方法消耗上下文窗口空间,并在级联压缩下性能退化。我们评估一种替代方案:在单张消费级GPU上,通过反思、综合与低秩适配(LoRA)微调,在夜间将交互知识固化到模型权重中。在十个真实软件开发会话上(n = 10,覆盖三种记忆类型的1,146道测试题),三轮级联压缩保留36.8 +/- 3.0%的知识(介于11.8%的无上下文下限与90.1%的全上下文上限之间),而知识固化保留80.4 +/- 1.3%——提升43.6个百分点(配对t(9) = 14.8,p < 0.001),超过压缩所保留内容的两倍,其中程序性修正(36.3% -> 74.6%)与情景性项目事实(31.5% -> 78.2%)收益最大。作为方法论上的附带发现,平均每词元验证交叉熵与LLM评判的准确率负相关(r = -0.51),而中位数每词元验证交叉熵几乎精确追踪准确率(r = +0.99):在容忍表面形式变化的评估器下,均值具有误导性,重尾稳健的统计量才是忠实信号。持久的个性化需要超越纯推理部署,走向将知识固化到权重中的架构。