论文
测试时个性化:扩展失败的诊断框架和概率修复
Test-Time Personalization: A Diagnostic Framework and Probabilistic Fix for Scaling Failures
摘要
现有的 LLM 个性化方法侧重于构建更好的个性化模型或输入,同时将推理视为单次过程。在这项工作中,我们沿着一个未探索的轴研究测试时个性化(TTP):通过从个性化策略模型中采样 N 个候选者并使用个性化奖励模型选择最佳者来扩展推理时间计算。我们证明,预言机选择产生的预期效用随着样本候选数量呈对数增长,从而建立了测试时间扩展的理论上限。然而,标准奖励模型未能实现这种潜力。为了诊断原因,我们推导出一个统一的缩放法则,将任何奖励模型的 Best-of-N 曲线分解为四个可测量的量,并揭示两种故障模式:用户级崩溃(对某些用户而言接近恒定的预测)和查询级 奖励作弊(与某些查询的真实质量负相关)。在该定律的指导下,我们提出了一种概率个性化奖励模型,其学习方差有效地减轻了两种失败模式。实验证实了我们框架的两个要素:TTP 在多个策略模型和个性化文本生成任务中提供一致的扩展,并且我们的扩展法则与奖励模型变体中观察到的扩展曲线紧密匹配。