论文
在面向任务的对话系统中通过无监督 微调 学习推理和使用工具
Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems
摘要
当前的对话系统难以应对动态信息检索,常常导致幻觉和较低的响应准确性。我们通过调整面向任务的对话的 ReAct 框架来解决这个问题,使 大语言模型 (LLM) 能够访问外部知识并产生事实响应。主要是,我们提出了一个无监督的 微调 管道,通过上下文学习推理来收获推理轨迹。使用基于 LLM 的判断来过滤高质量样本,以构建稳健的训练集。这是通过无监督的自我改进循环得到增强的,其中改进的检查点为后续的 微调 迭代生成越来越好的轨迹。 SIMMC 数据集上的实验表明,基于 ReAct 的系统由于卓越的推理和工具使用而优于基线。值得注意的是,我们经过微调的 8B 模型超越了 70B 上下文系统。最后,我们提出了错误分析、场景复杂性的影响和跨域泛化。