论文
C-Mining:通过几何错位无监督地发现文化数据合成的种子
C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment
摘要
在 大语言模型 (LLM) 中实现文化一致性越来越依赖于合成数据的生成。对于这种合成,最重要的初始步骤是种子管理;然而,目前的方法缺乏选择这些种子的量化标准。现有方法依赖于不可扩展的手动管理或容易产生偏差的 LLM 提取,将文化特异性视为抽象概念而不是可测量的信号。在本文中,我们通过提出 C-Mining 来解决这一“量化差距”,C-Mining 是一种无监督框架,它将文化种子的发现从主观选择过程转变为可计算的数据挖掘公式。我们的方法利用了一种新颖的几何洞察力,利用预先训练的嵌入空间内文化概念的跨语言错位作为可量化的发现信号。通过系统地识别这些具有明显语言排他性和几何隔离特征的区域,同时主动滤除噪音,C-Mining 自动从原始多语言语料库中提取高保真文化点 (CP),无需依赖人工或 LLM 监督,从而将准备成本降低 150 倍以上。我们进一步利用挖掘的知识来指导不同指令调整数据集的综合。大量实验表明,这种以种子为中心的方法显着增强了文化理解和推理能力,在CulturalBench-Hard上实现了+6.03点的改进,超越了最先进的基线,为高质量文化数据合成提供了可扩展、可量化的解决方案。