论文

LivingArena:LLM知道其他LLM不知道的吗?以同行探测作为可扩展评估

LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

模型评测评测方法与指标

摘要

固定基准的更新成本高昂,且无法根据模型特有的失败调整其题目。我们追问:LLM能否转而发现彼此的弱点,并将这些观察转化为一个评估过程?为研究这一问题,我们提出LivingArena,一个自动化的同行探测框架,其中模型轮流测试彼此。借助交互历史,每个提问者识别对手的潜在弱点,并构建有针对性且可验证的问题来探测它们。十个模型参与的3600轮锦标赛揭示出明显的角色不对称:强的答题者并不总是可靠的提问者,因为它们可能生成内部不一致的测试,或无法验证自己的参考答案。当提问者暴露出答题者的一次失败后,它更倾向于继续追问同一能力域,而答题者的弱点会在独立生成的问题上重复出现,包括由不同模型撰写的问题。这些发现表明,同行探测既能揭示模型特有的持续性弱点,又能分别评估答题能力与可靠测试构建能力。通过自动化这一过程并让测试难度随模型能力演化,LivingArena为模型开发、红队测试和能力感知的多智能体协作提供了一个“活的”基准。我们公开发布代码:https://github.com/galaxyChen/LivingArena

LivingArena:LLM知道其他LLM不知道的吗?以同行探测作为可扩展评估:论文配图
图 1:LivingArena 评估流程和动态弱点利用概述。在回答者做出回应并评分之前,提问者生成的问题和参考答案将由评审小组进行验证。在这里,在回答者未能通过编程问题后,提问者通过在下一轮中瞄准相同的维度来采用“命中后利用”策略。