论文

无需训练 大语言模型 的测试时对比学习

Training-Free Test-Time Contrastive Learning for Large Language Models

上下文与知识上下文工程

摘要

大语言模型(LLM)表现出强大的推理能力,但在分布转移下其性能往往会下降。现有的测试时间适应 (TTA) 方法依赖于基于梯度的更新,需要白盒访问并需要大量开销,而 无需训练 替代方法要么是静态的,要么依赖于外部指导。在本文中,我们提出了 无需训练 测试时对比学习 TF-TTCL,这是一种 无需训练 适应框架,使冻结的 LLM 通过从自己的推理经验中提取监督来在线改进。具体来说,TF-TTCL通过三个核心模块实现了动态的“探索-反思-引导”循环:1)语义查询增强首先通过多智能体角色扮演使问题视图多样化,以生成不同的推理轨迹; 2)对比体验 蒸馏 然后捕获优劣轨迹之间的语义差距,将它们提炼成明确的文本规则; 3) 上下文规则检索最终在推理期间激活这些存储的规则,以动态引导冻结的 LLM 走向稳健的推理模式,同时避免观察到的错误。对封闭式推理任务和开放式评估任务的大量实验表明,TF-TTCL 在在线评估下始终优于强大的零样本基线和代表性 TTA 方法。代码可在 https://github.com/KevinSCUTer/TF-TTCL 获取。