论文

RTLC——研究、教学、批评:受费曼学习技术启发的三阶段提示范式,在没有 微调 的情况下提高了 JudgeBench 上 LLM 作为法官的准确性

RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning

模型评测评测方法与指标

摘要

LLM-as-a-judge 现在是开放式生成的默认测量工具,但在公共 JudgeBench 基准上,即使是强大的指令调整法官也很难在客观正确性成对项目上获得随机性。我们引入 RTLC,这是一个三阶段提示方法——研究、教学、批判——将单个黑盒 LLM 提升为整体思维判断,无需 微调、检索或外部工具。第 1 阶段将输入包装在固定的教学支架中,将费曼学习技术(学习 $\to$ 教学 $\to$ 发现差距 $\to$ 简化)移植到 LLM 提示中。第 2 阶段在温度 0.4 下得出 N=10 个独立候选结论。第 3 阶段充当自己的批评家,将候选集与原始问题进行交叉比较,在温度 0 时发出一个批评性的判决。在 JudgeBench-GPT(350 个硬配对项目)上,Claude 3.7 Sonnet 的配对准确率从 64.6%(单次普通提示)攀升至 78.6%(RTLC 批评 10)——绝对的增加 14.0 个百分点。 RTLC 还击败了 N=10 的自洽多数投票 (77.7%) 和零机会第一候选人 (74.0%)。干净的三步消融将+9.4 pp归因于教学支架,+3.7 pp归因于N=10边缘化,+0.9 pp归因于明确的批评。我们讨论了成本准确性边界(RTLC 在每个工作点都高于自我一致性)、四个 JudgeBench 类别(知识、推理、数学、编码)的误差预算细目,以及 RTLC 如何与事后法官评分校准正交组合,这两种干预措施在实践中乘法复合。