论文

Meow-Omni 1:用于猫科动物行为学的多模式 大语言模型

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

应用与实践行业应用

摘要

破译动物意图是计算行为学中的一个基本挑战,很大程度上是因为语义混叠,即相同的外部信号(例如猫的呼噜声)根据生理背景对应于完全不同的内部状态的现象。现有的多模态 大语言模型 (MLLM) 对高频生物时间序列数据视而不见,将其限制为表面行为模式匹配,而不是真正的潜在状态推理。为了弥补这一差距,我们推出了 Meow-Omni 1,这是第一个专为计算行为学构建的开源四模态 MLLM。它本身将视频、音频和生理时间序列流与文本推理融合在一起。通过有针对性的架构调整,我们将专门的科学编码器集成到统一的主干中,并通过生理基础的跨模式对齐将意图推断形式化。 Meow-Omni 1 在经过专家验证的新型四模态基准 MeowBench 上进行评估,实现了最先进的意图识别准确度 (71.16%),大大优于领先的视觉语言和全模态基准。我们发布了完整的开源管道,包括模型权重、训练框架和 Meow-10K 数据集,以建立用于物种间意图理解的可扩展范式,并推动基础模型走向现实世界的兽医诊断和野生动物保护。