论文

LLM 的测试时间增强:当输入分集在匹配计算时胜过输出分集时

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute

模型推理测试时计算扩展

摘要

测试时间扩展提高了 LLM 的准确性,但会增加推理成本,从而使每单位计算获得的准确性成为部署中重要的指标。自洽是已建立的方法之一,它通过对重复推理路径进行采样,将预算完全花在输出方面。我们研究测试时间增强(TTA),它通过扰动输入、聚合输入转换版本的预测来扩展自我一致性,并询问输入侧多样性是否比输出侧多样性更有效地将计算转换为准确性。我们进行了系统的、匹配计算的比较:我们在涵盖一般和多语言知识、数学推理、多模态问答和情感分类的六个数据集上评估三种简单的输入端策略(语义改写、词汇扰动和视觉转换),对照思维链提示和自我一致性。语义重新措辞可实现一致且具有统计显着性的准确性增益,同时在成本效益方面实现帕累托主导的自我一致性,每美元的准确性提高约 1.8 倍,并且在六项任务中的五项上表现优于它。我们进一步分析了增强数量、多模态策略和基础模型扩展,发现 TTA 对于无法获得更强大的模型或过于昂贵的中层模型来说最具成本效益。我们的研究结果表明,对于当前的中层 LLM,改变输入比单独改变推理路径更有效地将推理计算转换为准确性。 TTA 实施位于 https://github.com/aws-samples/sample-genai-reflection-for-bedrock。