论文
PersonTTS:按用户需求复用经验搜索推理控制策略
From Pareto to Preference: Personalized Test-Time Scaling via Amortized Agentic Policy Discovery
摘要
测试时间缩放(TTS)通过分配额外的推理计算来提高大型语言模型的推理能力。现有的提高 TTS 效率的方法主要是一次针对一个资源维度优化准确性,从而提高准确性(成本或准确性)延迟帕累托前沿。然而,用户需求是多维的:用户可以联合指定准确性、延迟和推理成本需求,并且不同的需求可能有利于不同的控制器。我们将个性化测试时间扩展制定为发现可执行控制器,最大限度地提高用户特定要求的联合满足率。为了减少新用户配置文件的重复策略发现的开销,我们提出了 PersonTTS,这是一种摊销的 Agentic 策略发现框架,它通过需求匹配的控制器初始化和源提取的程序指导来重用先前的搜索经验,同时保留每个候选者的目标配置文件评估。 AIME 和 HMMT 实验表明,PersonTTS 明显优于强 TTS 未见的用户配置文件和遗留问题的联合需求满足基线。在相同的候选评估预算下,跨用户体验重用进一步提高了策略质量,同时大大减少了发现Agent的时间和成本。
