论文

超越表面对齐:大模型的情境理解与生成控制

Beyond Surface Alignment: Grounding the Dynamics of Situational Understanding and Generative Control in LLMs

模型评测模型行为与机制分析

摘要

当前大语言模型的对齐训练主要关注流畅、安全和语调一致等表面行为。本文认为,这对日常聊天有效,却可能掩盖对真实情境理解不足,使模型表现自信但难以应对情境变化。我们提出基于情境与生成行为的对齐框架,分析模型怎样处理上下文输入和组织生成输出,再与人的需求对齐。首先评估情境理解:SitTest显示,即使上下文窗口很大,先进模型仍难以持续维持对变化环境的一致内部理解;ReCode显示模型依赖表面启发式,而非深层语法依赖,读取大量历史并不等于理解变化。其次评估生成行为:分支因子BF用于刻画生成空间,发现标准对齐训练使其过早收敛到固定风格;Hindsight还显示模型常不能理解自身生成。最后研究动态交互控制:AI Realtor用上下文工程弥补情境理解不足,基座模型与对齐模型协作把探索与风格约束分开,并提出可验证强化学习的退火采样,应用到成瘾支持等场景,以模型生成的解释作为高风险领域的沟通接口。整体方向是让智能体同时依据上下文和自身生成开展交互。