论文

第二种模型何时有帮助? LLM验证中的跨模型审查

When Does a Second Model Help? Cross-Model Review in LLM Verification

模型评测评测方法与指标

摘要

大语言模型现在生成代码、文档和分析,并且越来越多地用于审查此类输出。我们询问不同模型的第二次审查何时有帮助。基于作者早期的预印本(在一个模型中改变了上下文、重复和角色结构),我们在受控实验中测试了模型独立性:30 个工件,其中 150 个植入错误,10 个审核条件,以及来自两个开发人员的三个审核者模型的 900 次审核会话。在这个实验中,(1)顶级跨模型审稿人在 F1 中与新会话(CCR)中的同模型审稿人没有显着差异,这没有建立等价性; (2)两者发现的错误部分不同(Jaccard 41.2%); (3) 在两次审阅中,一次 CCR 加一次跨模型审阅比两次 CCR 审阅匹配更多的植入错误(56.7% vs. 42.7%;Holm 调整 p=.006),但顶级跨模型审阅者的审阅数量不会明显超过两次,因此模型差异和审阅者能力没有分开。轻量级跨模型评审员的得分不会高于同模型评审员。在未经测试的点估计中,保留审阅者的要求会提高两个较低层的 F1,但不会提高顶层的 F1,其模式取决于失败会话的评分方式。在分析之前,我们审核了所有会话记录,不包括 1 次来源不明的基线运行和 14 次失败的调用;还报告了所有会话的结果。对另一个基准的公共检测器输出进行部分检查既不重复也不与主要比较相矛盾。作者可根据要求提供记录、工件和脚本。