论文

结构化自洽:LLM在VirtualHome上的多任务评估

Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome

模型推理推理验证与自校正

摘要

具身AI要求智能体在模拟环境中理解目标、规划动作并执行任务。我们使用具身智能体接口(EAI)框架,对大语言模型(LLM)在VirtualHome基准上进行综合评估。我们比较两个代表性7B参数模型OPENPANGU-7B与QWEN2.5-7B,涵盖四项基础任务:目标解读、动作排序、子目标分解与转移建模。我们提出结构化自洽(Structured Self-Consistency, SSC),一种增强解码策略,利用多次采样与领域专属投票机制来提升结构化生成任务的输出质量。实验结果表明,SSC显著提升性能:OPENPANGU-7B在分层规划上表现出色,而QWEN2.5-7B在动作级任务上占优。我们的分析揭示不同模型类型的互补优势,为未来具身AI系统开发提供洞见。

结构化自洽:LLM在VirtualHome上的多任务评估
图2:结构化自洽性(Structured Self-Consistency,SSC)方法概览,为简单起见以 N=4 示例(实验使用 N=5)。该框架处理两类噪声:(1) 句法错误(例如损坏的 JSON)由 Schema Validator(Φ(y)=⊥)拦截。(2) 语义不稳定(例如 y_3 生成“OFF”而非“ON”)通过结构感知投票解决,少数派幻觉(Z_other)被一致的共识(Z*)以多数票否决。