论文
从视觉反馈到文本评论:基于图像的评论辅助的多智能体视觉语言框架
From Visual Feedback to Textual Reviews: A Multi-Agent Vision-Language Framework for Image-Grounded Review Assistance
摘要
用户上传的图像和视频形式的视觉反馈在电子商务平台中变得越来越普遍,因为它提供了产品质量、缺陷、包装条件和实际使用情况的真实证据。然而,仅视觉反馈往往缺乏明智决策所需的上下文解释和主观意见,而许多用户由于撰写详细评论所需的努力而提供有限的文本反馈。为了弥补这一差距,我们引入了基于图像的审核辅助,这是一项新颖的任务,旨在从用户上传的产品图像生成可编辑的审核草稿。与侧重于客观视觉描述的传统图像字幕不同,所提出的任务需要在具有挑战性的现实条件下(包括图像质量下降、过度放大、目标模糊和部分产品可见性)对产品特定的理解、情感估计和证据驱动的评论组成。我们提出了一个多智能体视觉语言框架,由四个专门角色组成:产品基础、视觉情感估计、视觉证据生成和评论综合。该框架采用明确的中间表示,包括产品实体、预测评级和证据摘要,以提高可解释性和视觉基础。对亚马逊评论电子数据集的精选子集进行的实验证明了根据视觉反馈生成连贯的、产品感知和情感感知的评论草稿的可行性。据我们所知,这是第一项将基于图像的评论辅助制定为多智能体视觉语言推理问题的研究,为电子商务系统中人工智能辅助评论创作迈出了实际的一步。