论文

走向有效的 LLM 理论:一种表征学习方法

Towards Effective Theory of LLMs: A Representation Learning Approach

模型评测模型行为与机制分析

摘要

我们提出了表征有效理论(RET),这是一个根据学习到的宏观状态而不是微观细节来描述 大语言模型 计算的框架。 RET 使用 BYOL/JEPA 式的自监督客观、粗粒度激活从隐藏状态轨迹中学习这些宏观状态,将其粗粒度激活为宏变量,从而保留与预测和解释相关的高级结构。我们评估这些宏变量是否与可解释性实际相关:RET 产生时间一致的状态,揭示推理的“心理状态”轨迹,捕获高级语义结构,支持对行为结果(例如阿谀奉承和对齐伪造)的早期预测,同时为引导几代人走向可解释的计算阶段提供因果处理。总之,这些结果表明 LLM 计算允许通过 RET 进行有用的有效描述:用于解释、预测和控制的高级、动态有意义的变量。