论文
TaskGround:面向全场景家庭推理的结构化可执行任务推断
TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning
摘要
在真实家庭部署中,家庭智能体往往需要基于完整的家庭场景和情境化的家庭请求来行动,而非依据清晰的任务规范。这类请求要求智能体识别与任务相关的实体、恢复预期的任务条件,并从周围场景上下文中解析顺序约束。我们将这一能力形式化为全场景家庭推理:给定完整家庭场景与情境化家庭请求,智能体必须先推断出可执行的任务结构,再生成落地到技能层面的动作序列。这一设定具有挑战性,因为完整家庭场景包含大量与任务无关的信息,使得直接的全场景提示既低效又易错。在实际部署中,隐私与本地算力约束进一步放大了这一挑战,这使得长上下文推理能力有限的紧凑开源权重模型更受青睐。我们提出TaskGround,一个免训练且模型无关的“场景关联—推断—执行”(Ground-Infer-Execute)框架,它将完整场景场景关联为紧凑的任务相关场景切片,推断可执行的任务结构,并将其编译为落地到技能层面的动作序列。为评估这一设定,我们推出FullHome,一个经人工验证、包含400项家庭任务的评估套件,覆盖多样的家庭尺度环境以及目标导向和过程约束两类需求。在FullHome上,TaskGround在专有模型和开源权重模型上都大幅提升了任务成功率。值得注意的是,它使Qwen3.5-9B在直接全场景提示下达到与GPT-5相当的水平,同时将总输入token成本降低至多18倍。我们的结果将可执行任务结构推断确定为全场景家庭推理的核心瓶颈,并表明结构化场景关联能让紧凑的本地模型在实际家庭部署中显著更加有效。
