能力是否会转化为主观行为——我们的仪器会告诉我们吗?自我进化、构建信任的评估范式
Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm
摘要
基准测试已经成熟,答案是可验证的——数学、代码、推理——但 LLM 增长最快的用途是主观的、面向人的:陪伴、情感支持、咨询。在那里,将度量与人类判断相关联的默认有效性测试没有稳定的锚点:评估者之间的一致性很低,由注释者身份构成,几乎不可重复,并且存在长度偏差。因此,我们无法回答重要的问题:基于客观基准的能力是否会转移到主观行为,我们的工具是否会告诉我们是否没有转移?我们为这个政权建立了一个工具,并报告它在边境揭示的情况。首先,我们贡献了一个自我进化的工具,它在乘法反游戏适应性下选择并创造自己的行为维度,当它停止改进时会自我停止;其次,一种基于构建的信任范式,通过在没有人类黄金标准的情况下建立的三个证书来赢得信任,其中人类评估者饱和(rho ~ 0.45);第三,它的发现是显而易见的——能力转移是可分离的。在 49 个模型、8 个系列和 24 个月中,主观行为是客观基准缩放无法延续的地方:最尖锐的情况,建议限制(知道何时不提供建议),是前沿的普遍最低维度,在 gpt-4.1->gpt-5 处,它向后运行,而总分隐藏了它——一种指令恢复的回归。温暖约束是通过模型生成来移动的,而不是通过原始规模、MoE 宽度、推理预算或推理模式来移动;开放权重帕累托前沿与封闭式旗舰产品相匹配,每次调用成本降低约 10-80 倍;四个法官家庭在进行的人类 ESConv 对话中复制了该标题。数据、代码、锁定的评分标准和判断提示将在发布后发布。