论文

多模式代理中实现错误的综合研究

A Comprehensive Study of Implementation Bugs in Multi-modal Agents

AI 基础设施可观测性

摘要

由 大语言模型 (LLM) 提供支持的多模态代理 (M-agents) 在各种复杂的开放世界场景中表现出色,例如自动驾驶和机器人技术。然而,它们与动态和多样化的多模式环境交互的独特要求带来了传统代理所面临的新的实施挑战。过时的观念、不可靠的规划和不适用的执行可能会导致交通事故和经济损失。尽管对代理问题的研究越来越多,但还没有针对 M 代理特定的实现错误进行系统的研究。为了弥补这一差距,我们对 M 代理中的实现错误进行了首次系统研究。我们从不同来源收集了 34 个具有代表性的 M-agent,并通过细致的过滤,从 1,268 个问题报告中识别出 158 个 M-agent 特定的错误。使用自上而下的策略,我们开发了一个全面的分类法,根据全局症状、功能组件级症状和根本原因对错误进行分类。然后,我们通过分析运行时组件间输出来实现 MATester,这是一种自动概念验证错误识别器。当应用于 12 个额外的 M 代理时,MATester 成功覆盖了 61.4% 的已知未解决问题,并发现了 31 个额外的错误,证明了我们研究的实际用途。我们的工作为 M-agent 错误的分类、预防和修复提供了全面的参考和指南。