论文

ReacTOD:用于零样本对话状态跟踪的有界神经符号代理 NLU

ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking

智能体系统Agent 架构与控制循环

摘要

面向任务的对话系统(处理交易、预订和服务请求)需要可预测的行为,但实际延迟所需的中等大小的 LLM 很容易出现幻觉和格式错误,进而导致不正确的操作(例如,预订了错误的日期的酒店)。我们提出了 ReacTOD,一种有界神经符号架构,它将 NLU 重新表述为由确定性验证控制的自校正 ReAct 循环内的离散工具调用。有界 ReAct 循环可实现迭代自我校正,与 MultiWOZ 上的单遍推理相比,准确率提高了 9.3 个百分点。符号验证器在每次对话状态更新时强制执行操作合规性、模式一致性和共指一致性,对截获的错误实现 93.1% 的自我纠正率,并生成结构化执行跟踪。增量状态预测和按需历史检索使提示保持紧凑,从经验上提高了参数约束模型中的指令依从性。在 MultiWOZ 2.1 上,ReacTOD 实现了新的零样本最先进水平:gpt-oss-20B 达到了 52.71% 的联合目标准确率,超出了之前的最佳水平 14 个百分点,而 Qwen3-8B 仅用 8B 参数就达到了 47.34%。在 Schema-Guided Dialogue (SGD) 基准上,使用 Claude-Opus-4.6 的 ReacTOD 在预测域的完全端到端评估下实现了 80.68% 的 JGA,而 Qwen3-32B 则达到了 64.09%——展示了无需特定任务训练数据的跨基准泛化能力。