论文

超越助手回合:将用户回合生成作为语言模型交互意识的探针

Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models

模型评测模型行为与机制分析

摘要

标准LLM基准评估的是助手回合:模型针对输入生成响应,验证器对正确性打分,分析到此结束。这一范式没有测量LLM是否对助手响应之后的走向具有任何意识。我们提出用用户回合生成作为探测这一空白的手段:给定用户查询与助手响应构成的对话上下文,让模型以用户角色进行生成。如果模型权重编码了交互意识,其生成的用户回合将是对前文语境作出反应的、有依据的后续追问。通过跨11个开源权重LLM(Qwen3.5、gpt-oss、GLM)和5个数据集(数学推理、指令遵循、对话)的实验,我们表明交互意识与任务准确率是解耦的。特别是在Qwen3.5家族中,GSM8K准确率从41%(0.8B)提升至96.8%(397B-A17B),但确定性生成下的真实后续追问率仍接近于零。相比之下,更高温度的采样揭示交互意识是潜伏存在的,后续追问率可达22%。受控扰动验证了所提探针测量的是模型的真实属性,而在Qwen3.5-2B上开展面向协作的后训练则证明后续追问率可以提升。我们的结果表明,用户回合生成捕捉到了LLM行为的一个维度——交互意识——这是现有仅针对助手回合的基准所无法观察且尚未探索的。

超越助手回合:将用户回合生成作为语言模型交互意识的探针:论文配图
图 1:用户轮流生成作为交互感知的探针。左:由系统、用户和助理组成的对话上下文,由特殊标记(例如 <|im_start|>、<|im_end|>)分隔。标准评估对助理响应的任务准确性进行评分。我们的探针附加一个 <|im_start|>user header 并让模型 MθM_{\theta} 在用户角色下生成。真正的后续行动表明模型的权重编码了对话意识。右:三个数据集的六个模型的真实随访率 (%) 与采样温度。在贪婪解码 (T=0T{=}0) 下,大多数模型产生接近于零的后续结果。温度升高会导致 Qwen3.5 和 GLM 中的潜在交互意识(例如,Qwen3.5-27B 在 GSM8K 上从 0%0\% 上升到 22%22\%),而 gpt-oss 保持在接近零的水平。 Qwen3.5-9B 在 GPQA Diamond 上以更高的基线随访 (13.1%13.1\%) 开始,并随着温度进一步升高。