论文
从概率到决策:Jev的搜索与多教师蒸馏
From Probabilities to Decisions: Search and Multi-Teacher Distillation with Jev
摘要
仅概率模型(TypeSafe 称之为系统一模型)会在几毫秒内返回固定选择的校准概率,并且不生成任何文本。我们通过两项需要在严格约束下做出决策的任务来研究这样的模型 Jev。在子弹象棋中,将 Jev 的判断与开局书和残局桌库一起放入 Stockfish 搜索中的机器人相对于其他机器人,其 Lichess 子弹评级超过 2200。实时模型调用对于搜索来说太慢了,因此我们将成对判断提炼到一个在每个位置运行的紧凑评估器中。然后,我们询问当LLM Qwen3-32B 可以作为第二位老师时,如何最好地花费固定的标签预算。在国际象棋领域,平均两位评委的标签比仅花在 Qwen 上的整个预算高出 9.6 Elo(95% 区间为 4.3 到 14.9),并且这种收益会在新的空缺中复制;同一个评委的第二个答案是不可替代的,Jev 是测试模型中 Qwen 最强的搭档。在段落重新排名中,Jev 的标签单独训练了一个重新排名器,其得分与 Qwen 的一样高,API 调用时间为 21 分钟,而不是 5.1 个 GPU 小时,并且添加 Qwen 在排名质量方面最多获得千分之几的增益。搜索提供了前瞻,蒸馏使判断足够便宜,可以在每个位置使用,LLM合作伙伴在国际象棋中得到了回报。