论文
RepBench:将基准编译为 大语言模型 的能力表示
RepBench: Compiling Benchmarks into Capability Representations for Large Language Models
摘要
表示工程读取并引导 大语言模型 中的能力方向,但方法通常根据特定于论文的合成数据进行评估。所得测量结果难以比较或再现,并且可能反映表面模式而不是能力。我们推出了 RepBench,这是一个基于基准的数据层,用于功能一致的表示探测。爬取 13,427 篇基准论文,得出 13 个家族 182 个能力集群的分类;收集 353 个公共基准数据集产生了 46,149 个经过审计的探测文本,涵盖 94 种功能,每个功能都由至少两个独立基准支持。这种多基准设计减少了对任何单一来源的依赖:原始的每文本向量没有表现出自然的聚类粒度,而基准池能力向量在所有 12 个评估模型上的少量聚类上显示出内部聚类最佳值,与人类分类学的一致性较低。在所有四个读数完成的十二个模型的跨基准转移评估下,均值差异在十个模型上获得了最高的模型级平均值,而逻辑回归赢得了最多的能力模型单元。这种分歧说明读出方法和聚合标准是有意义的评价维度。管道、语料库和评估代码作为可重用的闭环工作流程发布。