论文

离策略 的自回归扩散世界模型 LLM 代理的评估

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

模型评测评测方法与指标

摘要

在多轮交互环境中评估 大语言模型 (LLM) 代理是昂贵且有风险的,因为它需要在线环境交互。我们提出 ADWM(自回归扩散世界模型),这是一种评估框架,纯粹根据预先收集的轨迹来估计新 LLM 代理策略的性能。核心思想是学习一个潜在扩散世界模型,该模型模拟环境如何响应评估策略,而无需在真实环境中执行它。现有的基于扩散的 OPE 方法通过联合扩散状态和动作,在一次传递中引导完整的轨迹,这种假设对于 LLM 代理来说是不成立的,其行为是离散文本,必须在观察环境后从策略中采样。与遭受复合误差的自回归世界模型不同,ADWM 将每次转换建模为独立的去噪过程,从而实现可靠的逐步执行轨迹,其中世界模型和智能体按因果顺序交替。至关重要的是,接受评估的 LLM 智能体通过策略条件评分函数直接指导每一步的扩散生成,确保模拟轨迹准确反映其决策模式。根据经验,ADWM 在不同的多轮代理任务中实现了准确的价值估计和评估可靠性,证明了其作为离线 LLM 代理评估的实用框架的前景。