论文

我们到了吗?探索 MLLM 在辅助 AI 应用中的功能

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 通过将视觉编码器与大规模语言模型相结合,重新定义了视觉理解。这种统一的架构可以在图像字幕、视觉问答和多模态对话等任务上实现强大的性能,通常在零镜头和少镜头设置中。 MLLM 的通用功能和灵活的接口使它们成为现实世界视觉语言应用的有希望的基础。辅助人工智能旨在帮助用户通过自然语言与环境进行交互。这些场景需要 MLLM 提供的强大的视觉识别、上下文推理和多语言理解能力。然而,它们在辅助环境中的有效性仍有待充分了解。在这项工作中,我们通过评估现实世界任务的最先进模型来探索 MLLM 是否可以支持辅助人工智能:识别货币等日常物体,根据场景文本回答问题,以及阅读跨多种语言的视觉呈现内容。为此,我们开发了一个系统 NetraLink,使用头戴式 GoPro 来捕获现实世界中以自我为中心的数据,并收集了涵盖这些辅助场景的基准。我们的研究结果对当前 MLLM 进行了全面的诊断,强调了它们在实现基于视觉感知和语言交互的辅助技术方面的优势和局限性。