论文
LivingArena:LLM知道其他LLM不知道的吗?以同行探测作为可扩展评估
LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation
摘要
固定基准的更新成本高昂,且无法根据模型特有的失败调整其题目。我们追问:LLM能否转而发现彼此的弱点,并将这些观察转化为一个评估过程?为研究这一问题,我们提出LivingArena,一个自动化的同行探测框架,其中模型轮流测试彼此。借助交互历史,每个提问者识别对手的潜在弱点,并构建有针对性且可验证的问题来探测它们。十个模型参与的3600轮锦标赛揭示出明显的角色不对称:强的答题者并不总是可靠的提问者,因为它们可能生成内部不一致的测试,或无法验证自己的参考答案。当提问者暴露出答题者的一次失败后,它更倾向于继续追问同一能力域,而答题者的弱点会在独立生成的问题上重复出现,包括由不同模型撰写的问题。这些发现表明,同行探测既能揭示模型特有的持续性弱点,又能分别评估答题能力与可靠测试构建能力。通过自动化这一过程并让测试难度随模型能力演化,LivingArena为模型开发、红队测试和能力感知的多智能体协作提供了一个“活的”基准。我们公开发布代码:https://github.com/galaxyChen/LivingArena
