论文
结构化自洽:LLM在VirtualHome上的多任务评估
Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome
摘要
具身AI要求智能体在模拟环境中理解目标、规划动作并执行任务。我们使用具身智能体接口(EAI)框架,对大语言模型(LLM)在VirtualHome基准上进行综合评估。我们比较两个代表性7B参数模型OPENPANGU-7B与QWEN2.5-7B,涵盖四项基础任务:目标解读、动作排序、子目标分解与转移建模。我们提出结构化自洽(Structured Self-Consistency, SSC),一种增强解码策略,利用多次采样与领域专属投票机制来提升结构化生成任务的输出质量。实验结果表明,SSC显著提升性能:OPENPANGU-7B在分层规划上表现出色,而QWEN2.5-7B在动作级任务上占优。我们的分析揭示不同模型类型的互补优势,为未来具身AI系统开发提供洞见。
