论文
超越拼接假设:通过语义量化进行多模态综合数据评估的统一框架
Beyond the Stitching Assumption: A Unified Framework for Multimodal Synthetic Data Evaluation via Semantic Quantization
摘要
多模态合成数据集将结构化属性与自由文本相结合,但通常单独评估。在表格文本配对被破坏后,此类指标仍可保持较高水平。我们提出了一种基于投影的表格文本合成数据评估器。固定句子编码器将文本映射到嵌入,\(k\)-means 将它们转换为集群状态,表格变量表示为分类或分位数分级状态。使用 Jensen-Shannon 散度 (JSD)、归一化互信息 (NMI)、条件 JSD (cJSD) 和联合状态熵来比较真实列联表和合成列联表。我们还报告了文本到属性 (T2A) 实用程序和保持校准的接近标记率 (PFR) 作为表示级诊断。文本排列控制保留了两个边缘分布,同时破坏了它们的配对。对亚马逊评论、Kiva 贷款和就业诈骗爱琴海数据集的实验表明,在此控制下,特定模式的得分仍然很高。当实际投影依赖性超过排列基线时,投影诊断会检测到破坏,但对于弱或稀疏投影,信息量较少。一些条件大语言模型基线还表现出比相应的实际数据预测更强的测量依赖性。这些结果支持通过排列基线和覆盖报告进行明确的跨模式评估。