论文

FLEET:从 Logits 熵到文本生成中的增强轨迹

FLEET: From Logits Entropy to Enhanced Trajectories in Text Generation

模型推理解码与生成控制

摘要

基于大型语言模型 (LLM) 的解决方案通常依赖于温度采样,通过聚合完成分布中的多个样本来提高准确性和稳定性。然而,这种无记忆的方法本质上是次优的:因为它缺乏对前几代人及其评估的认识,随着抽取的样本越来越多,它会产生越来越多的语义重复答案,从而导致回报递减。为了解决这个限制,我们引入了 FLEET,这是一种将内存机制集成到生成过程中的新颖方法。 FLEET 将每一代表示为熵超过预定义阈值的状态的稀疏轨迹,并使用这些轨迹来推断调整 logits 的每个词元效用分数。基准评估表明,FLEET 实现了与重复采样基线相同的精度,加速速度提高了 3 倍,并在相同预算下大幅提高了复杂编码任务的精度(LiveCodeBench Pass@32 从 59.9% 提高到 66.2%)。此外,在此处评估的贪婪解码配置中,该方法是确定性的,并使用单个校准过程来导出其主要超参数,只需要对现有 LLM 管道进行最小程度的修改。