论文

可控用户模拟

Controllable User Simulation

模型评测评测方法与指标

摘要

使用离线数据集评估对话智能体往往无法覆盖罕见场景,也难以支持对新策略的测试。这促使人们使用可控用户模拟器进行有针对性的反事实评估,其通常通过提示或微调大语言模型实现。在本工作中,我们将可控模拟形式化为一个因果推断问题。通过将自然语言评估与离线策略评估(off-policy evaluation)方法相衔接,我们表明:在事后轨迹标签上通过监督微调训练模拟器的标准做法会产生一个结构性有偏的模型。具体而言,这些标签与生成数据的行为策略不可避免地耦合在一起,注入了破坏因果一致性的前瞻偏差(look-ahead bias)。此外,我们证明在策略偏移下,这种失败会导致评估指标的方差呈几何级数式爆炸,我们将这一现象称为可控性崩溃(controllability collapse)。为恢复因果一致性,我们建立了精确模拟的理论条件,并提出实用的训练缓解方案:先验控制、逐步动态控制以及直接的策略条件化学习。实证评估证实:尽管标准的全局控制会扭曲对话分布并使行为多样性坍缩,但我们基于因果的模拟器消除了前瞻偏差,保留了自然方差,并对未见过的智能体行为展现出稳健的零样本泛化。

可控用户模拟:论文配图
图 2:现实性与可控性的权衡。明确提示的模型实现了较高的依从性,但遭受了严重的多样性崩溃。 N 次最佳采样完全失败。因果条件模型提供了优越的帕累托前沿。表 2:控制依从性分数。通过LLM判断并嵌入余弦相似性,平均值 ±\pm 95% CI。