论文

PersonTTS:按用户需求复用经验搜索推理控制策略

From Pareto to Preference: Personalized Test-Time Scaling via Amortized Agentic Policy Discovery

模型推理上下文与知识智能体系统测试时计算扩展记忆智能体自我改进

摘要

测试时间缩放(TTS)通过分配额外的推理计算来提高大型语言模型的推理能力。现有的提高 TTS 效率的方法主要是一次针对一个资源维度优化准确性,从而提高准确性(成本或准确性)延迟帕累托前沿。然而,用户需求是多维的:用户可以联合指定准确性、延迟和推理成本需求,并且不同的需求可能有利于不同的控制器。我们将个性化测试时间扩展制定为发现可执行控制器,最大限度地提高用户特定要求的联合满足率。为了减少新用户配置文件的重复策略发现的开销,我们提出了 PersonTTS,这是一种摊销的 Agentic 策略发现框架,它通过需求匹配的控制器初始化和源提取的程序指导来重用先前的搜索经验,同时保留每个候选者的目标配置文件评估。 AIME 和 HMMT 实验表明,PersonTTS 明显优于强 TTS 未见的用户配置文件和遗留问题的联合需求满足基线。在相同的候选评估预算下,跨用户体验重用进一步提高了策略质量,同时大大减少了发现Agent的时间和成本。

PersonTTS:按用户需求复用经验搜索推理控制策略:论文原图
图 1:现有测试时间缩放范例与个性化测试时间缩放的比较。现有方法主要针对延迟或推理成本分别优化准确性,而个性化 TTS 则针对用户特定要求下的共同满意度。 PersonTTS 通过重用需求匹配的控制器和先前搜索的程序指导来分摊用户调节的控制器发现。