论文

公制-结构耦合增强了测量的综合方言恢复

Metric-Construction Coupling Inflates Measured Synthetic Dialect Recovery

模型评测评测方法与指标

摘要

韩语方言语料库可用,但不可重新分发:权重可以发布,但不能从基础数据中再现训练和评估。我们询问监督合成数据恢复了多少,以及恢复是否可以独立于合成管道进行测量。我们贡献了 KoDialectBench,三个轴上五个区域的 1,000 个项目,以标识符哈希值和评分代码的形式发布,以便用户从自己的许可副本中重建项目。恢复强烈依赖于轴:我们最好的合成臂在区域识别方面达到了 91.2% 的真实数据增益,但在理解方面达到了 63.7%。在生成时,答案取决于指标:部署的标记词典报告方言匹配度为 92.3%,区域匹配度为 119.3%,后者超过了实际数据参考,而基于参考的生成则达到 72.4%。我们发现标记指标的评分清单完全包含在我们的转换规则可以发出的清单中。我们使用精确形式的构造分离臂直接测试构造访问的效果,该臂从规则中保留了 20% 的标记类型。在完全匹配的训练规模(8,600 个示例)下,它将保留标记库存的方言恢复率从 91.8% 降低到 8.1%,区域匹配恢复率从 101.9% 降低到 25.6%,而三个与管道无关的测量根本没有下降。补充评估器扫描定义了度量结构覆盖范围 (MCC),并发现测量的方言恢复随着重叠从 MCC=0 上升到 MCC=1 而单调增加。因此,共享构建和评估清单可能会大大夸大合成数据恢复的估计。