论文
AdaptFuse:通过外部化贝叶斯推理进行 无需训练 顺序偏好学习
AdaptFuse: Training-Free Sequential Preference Learning via Externalized Bayesian Inference
摘要
大语言模型 难以在多轮用户交互中积累证据,未能以与贝叶斯推理一致的方式更新他们的信念。现有解决方案需要 微调 来处理敏感的用户交互数据,从而限制了它们在注重隐私的设置中的适用性。我们提出了 AdaptFuse,一个 无需训练 框架,它完全从 LLM 外部化概率计算:符号模块在离散假设集上维护贝叶斯后验,而冻结的 LLM 通过多样本狄利克雷聚合贡献语义推理。这两个信号通过熵自适应融合进行组合,自动根据预测置信度对每个源进行加权,随着证据的积累,将依赖从 LLM 转移到符号后验。我们评估三个领域:航班推荐、酒店推荐和网络购物;在 Gemma 2 9B、Llama 3 8B 和 Qwen 2.5 7B 上。 AdaptFuse 在所有任务上始终优于提示基线和微调贝叶斯教学模型,并且准确性在交互轮次中单调提高。这些结果表明,有原则的推理时间算法可以在个性化推荐中替代 微调,而无需存储或训练敏感的用户数据。所有代码和材料都将开源。