论文

HomeFlow:基于可验证模拟的智能家居智能体训练数据飞轮

HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation

模型训练强化学习合成数据Agentic RL

摘要

大语言模型智能体正从纯文本交互走向物理世界控制,智能家居是其中的代表性领域。真实的家庭交互需要理解模糊意图、在动态环境中操作,并进行多轮推理。然而,现有方法难以为智能家居智能体生成高质量训练数据。我们提出面向该领域的可验证数据飞轮HomeFlow。HomeFlow以HomeEnv作为统一模拟环境,并以HomeMaker程序化生成多样化的家庭设定。随后,Blueprint将开放式用户意图编译为可执行的基于状态的成功条件,MCTS-Flow则通过环境引导的树搜索合成多样且可验证的多轮轨迹。接着通过监督微调与分步RLVE优化智能体,借助真实物理反馈促成迭代改进。我们还构建了SmartHome-Bench,在多种智能家居任务上评估智能体。在该基准上,HomeFlow-RL-4B和HomeFlow-RL-8B分别取得84.60%和87.03%的任务成功率。值得注意的是,HomeFlow-RL-8B甚至以1.23个百分点的优势超越了领先的GPT-5.5。

HomeFlow:基于可验证模拟的智能家居智能体训练数据飞轮:论文配图
图 1:HomeFlow 概述。 HomeMaker基于HomeEnv生成多样化的家庭环境。然后,蓝图创建可执行的场景条件,然后通过 MCTS-Flow 合成不同的、可验证的轨迹。从这个架构中,我们得出了三种数据合成策略:(M1)纯文本角色扮演(无蓝图); (M2) 基于蓝图的线性生成(无 MCTS-Flow); (M3) 完整的 HomeFlow 管道。