论文

TimeLens:大埃及博物馆的设备上文物识别和检索增强问答

TimeLens: On-Device Artifact Recognition with Retrieval-Augmented Question Answering for the Grand Egyptian Museum

应用与实践行业应用

摘要

TimeLens 是大埃及博物馆 (GEM) 的人工智能双语移动指南。参观者将手机指向展品,即可看到实时识别的文物,并可以提出后续问题,并用英语或阿拉伯语回答。这项工作解决了画廊内部署所特有的三个问题:51 件编目文物(许多几乎相同的拉美西斯雕像)之间的细粒度视觉相似性、策划的训练数据和手持相机条件之间的差距,以及人工智能指南陈述不受支持的历史事实的风险。报告了两项工程贡献。首先,通过数据质量驱动的迭代研究开发了设备上的文物识别器 - 从基础模型自动注释 (YOLO-World),通过空间标签清理规则,到完全手动注释的数据集 - 将标签质量隔离为决定性因素:最终的 YOLOv8n 模型解决了之前每个失败的类,同时保留了在中端手机上实时运行的 5.97 MB TensorFlow Lite 资产 (mAP@0.5 = 0.995,mAP@0.5:0.95 = 0.924)。其次,基于 108 条记录的 ChromaDB 知识库的双语检索增强生成 (RAG) 指南在七种候选语言模型中进行了基准测试,其中选择了 Gemma 4 E2B (Q4 K M);十项有针对性的优化将端到端延迟从 30 秒以上减少到大约 10 秒。这两个子系统都集成在具有双语界面、博物馆位置门控和文本转语音支持的生产 Flutter 应用程序中。