论文

纠正和损坏:LLM 协议中错误流的二速率视图

Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols

模型评测评测方法与指标

摘要

大语言模型 在包含多个调用的协议中运行,但添加的调用通常仅根据其净效果进行评估。该摘要无法区分纠正不成功的输出和破坏最初成功的输出。我们开发了一种配对审计,记录在一个二进制规则下对相同任务执行指定操作之前和之后的成功情况。纠正率和腐败率准确地解释了净变化:收益来自纠正的失败,损失来自腐败的成功。随着基线成功,盈亏平衡校正要求急剧上升,因此相同的行为可以改善中等基线人群,但会损害高基线人群。该框架应用于已发布的 GPT-4 GSM8K 结果,将样本内校正和损坏计数与聚合精度结合起来。我们询问校准估计是否可以预测未观察到的结果,速率如何随提供给操作的信息而变化,以及连续测量是否结合在一起。校准估计来自同一发生器的不相交样本的跟踪精度。在对生成器定义的组进行重新加权的情况下,合并估计可能会失败,而特定于组的估计会减少平均预测误差。在 GSM8K 上,可观察的特征捕获这些样本大小的有限变化,因此组级应用规则仍然是探索性的。对固定的四候选集重新排序会改变两个速率,其准确度效果取决于是否有正确的替代方案可用;在 MBPP 上,添加辅助工件会使 357 个最初通过的程序中的损坏从 28 个增加到 100 个。样本内的直接过渡估计和组合过渡估计平均接近;通过支持对初始成功行进行加权可以大大减少保留的差异。纠正和损坏是指定操作的测量,而不是模型常量,并且可以指导输入选择、应用程序决策和组合测试。