论文

STREAM:一个以数据为中心的框架,用于从流媒体中挖掘高价值的面向任务的对话

STREAM: A Data-Centric Framework for Mining High-Value Task-Oriented Dialogues from Streaming Media

模型训练合成数据

摘要

垂直领域的 大语言模型 因缺乏复杂的、面向特定领域的任务的对话而受到瓶颈。现有的数据采集管道面临着持续的三难困境:专家注释成本高昂,现实世界的服务对话受到隐私和商业限制,静态语料库很快就会变得过时。我们提出了 Stream,一个以数据为中心的框架,利用公开的流媒体(直播流和短视频)来大规模合成高价值的服务对话。 Stream从嘈杂的流中挖掘真实的交互信号,并通过将基于角色的角色构建与对话蓝图构建相结合来合成对话;它进一步采用检索增强生成(RAG)来支持知识感知响应。基于Stream,我们发布了涵盖汽车、餐厅、酒店的大规模多领域数据集StreamDial。 StreamDial 总共包含 87,498 个对话会话和 1,497,320 个回合,平均每个会话 17.11 个回合,跨域规模相当。每个会话都被组织为结构化四元组 $\langle P_u, P_a, B, H \rangle$,将对话历史与明确的用户/代理角色和对话蓝图配对,捕获现实的服务行为,例如需求挖掘、约束冲突、协商和恢复。对自动法官和下游任务的评估表明,StreamDial 在强基线上提高了内在对话质量,并且使用 StreamDial 训练的模型改进了跨骨干网的对话状态跟踪;我们进一步报告了完整的人类评估集,并鼓励在受控的训练预算下在 Qwen3-8B 上进行多语言迁移。数据发布于https://github.com/hitxueliang/DialogDataSetBySTREAM。