论文

PoolBench:仅解码器 LLM 概念表示评估中池化策略的基准

PoolBench: A Benchmark for Pooling Strategies in Concept Representation Evaluation for Decoder-Only LLMs

模型评测基准与评测资源

摘要

在仅解码器的概念表示工作中,池化是一个重要但未经充分审查的设计选择:从业者必须将 词元级 隐藏状态折叠为通道级向量,但不存在用于在概念、模型和任务之间比较此选择的共享协议。报告的收益因数据集、图层、构建方法和池化规则的同时变化而混淆,使得原则性决策变得不可能。我们引入了 PoolBench,这是一个基准测试,它将池化作为固定评估协议下的实验变量进行隔离。 PoolBench 涵盖 17 个概念、19 种池化策略和 3 个开放权重解码器模型(Llama-3.1-8B、Gemma-2-9B、Mistral-7B),在包含 37,693 个真实文本段落的单个审核语料库上进行评估。主轴为线性可分性(D1/AUROC);引导概念流行度(D2/SCP)和产出水平解理(D3)作为诊断轴。主要发现是决定性的:W4_hierarchical 的跨模型平均 AUROC 为 0.7799,而广泛采用的 P1_last_token 基线仅达到 0.7640,并且在统计上显着较差(Friedman+Nemenyi,p = 2.0e-36;18 个有效策略中的 77 个显着对)。各层排名稳定 (rho = 0.961--0.990)。一个关键的负面结果:强检测并不意味着强转向——对于大多数概念来说,D2 和 D3 明显弱于 D1,这表明存在基本的代表性限制,而不是池化失败。在中等难度的概念上,W4_hierarchical 优于 P1_last_token 0.042--0.113 AUROC;构造方法选择(DiffMean 与 REPE)比池化(delta AUROC 0.016)具有更大的影响(delta AUROC 0.15),建立正确的实用层次结构。我们发布语料库、预提取的激活、评分器模型、引导向量和评估代码,作为池化研究的可重用协议。