论文

CiQi-Agent:在多模态代理中协调视觉、工具和美学,对中国瓷器进行文化推理

CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains

应用与实践行业应用

摘要

中国古董瓷器的鉴赏需要丰富的历史知识、材料理解和审美敏感性,非专业人士很难参与。为了使文化遗产理解民主化并协助专家鉴赏,我们推出了 CiQi-Agent——一款针对特定领域的瓷器鉴赏代理,用于对中国古董瓷器进行智能分析。 CiQi-Agent支持多图像瓷器输入,并支持视觉工具调用和多模态检索增强生成,对朝代、统治时期、窑址、釉色、纹饰和器形六个属性进行细粒度的鉴赏分析。除了属性分类之外,它还捕获微妙的视觉细节,检索相关领域知识,并整合视觉和文本证据以生成连贯的、可解释的鉴赏描述。为了实现这一能力,我们构建了一个大规模的、专家注释的数据集CiQi-VQA,包括29,596个瓷器标本、51,553张图像和557,940个视觉问答对,并进一步建立了与前面提到的六个属性相一致的综合基准CiQi-Bench。 CiQi-Agent 通过监督 微调、强化学习和工具增强推理框架进行训练,该框架集成了两类工具:视觉工具和多模态检索工具。实验结果表明,CiQi-Agent (7B) 在 CiQi-Bench 上的所有六个属性上均优于所有竞争性开源和闭源模型,比 GPT-5 平均准确率高 12.2%。该模型和数据集已发布并可在 https://huggingface.co/datasets/SII-Monument-Valley/CiQi-VQA 上公开获取。