论文
LatentVerse:理解多模态潜在表示中共享和模态特定信息的框架
LatentVerse: A Framework for Understanding Shared and Modality-Specific Information in Multimodal Latent Representations
摘要
潜在嵌入已成为现代机器学习中的核心数据抽象,特别是在生物医学中,基础模型越来越多地用于编码临床文本、医学图像、组学和生理信号等多模态数据。然而,这些表示的效用和价值取决于对它们的质量、结构和它们编码的信息的理解。用于评估表示的现有分析工作流程仍然分散在自定义脚本和孤立的指标中,最重要的是缺乏多模式分析,限制了可访问性和可重复性。我们推出 LatentVerse,这是一种表示分析资源,它将基于 Web 的可视化分析平台(用于可访问的、报告驱动的探索)与用于可扩展技术工作流程的命令行界面相结合。 LatentVerse 统一了各种表示质量指标的诊断,并通过将嵌入分解为共享和特定于模态的组件来扩展到多模态设置。我们通过受控的单模态和多模态模拟、对真实生物医学嵌入的发现导向分析以及跨不同用例的用户研究来评估 LatentVerse。通过支持对潜在空间进行彻底且可解释的评估,LatentVerse 使基础模型表示在生物医学和数据科学应用中更易于理解。