论文

大语言模型 的查询条件测试时间自训练

Query-Conditioned Test-Time Self-Training for Large Language Models

模型训练参数高效训练

摘要

大语言模型(LLM)通常使用固定参数进行部署,并且通常通过在推理时分配更多计算来提高其性能。虽然这种测试时间缩放可能是有效的,但它无法纠正模型误解或使模型适应单个查询的特定结构。测试时优化通过在推理期间启用参数更新来解决此限制,但现有方法要么依赖外部数据,要么优化缺乏特定于查询的对齐的通用自我监督目标。在这项工作中,我们提出了查询条件测试时自训练(QueST),这是一个框架,可以在推理期间使用直接从输入查询派生的监督来调整模型参数。我们的主要见解是输入查询本身编码足以构建结构相关的问题-解决方案对的潜在信号。基于此,QueST 生成此类查询条件对,并在测试时将它们用作参数高效 微调 的监督。然后使用调整后的模型生成最终答案,从而无需任何外部数据即可实现特定于查询的调整。在七个数学推理基准和 GPQA-Diamond 科学推理基准中,QueST 始终优于强大的测试时间优化基准。这些结果表明,查询条件自训练是 LLM 中测试时间适应的有效且实用的范例。代码可在 https://chssong.github.io/Query-Conditioned-TTST/ 获取。