论文
量化合成数据中的容错性:原子级操作数与算子扰动研究
Quantifying Error Tolerance in Synthetic Data: An Atomic-level Operand vs. Operator Perturbation Study
摘要
合成数据生成已成为推进 大语言模型 的基石。然而,缺乏对容错性的定量分析成为了一个关键瓶颈。因此,当前的过滤策略在两个极端之间波动:要么过于激进,冒着排除潜在有价值样本的风险,要么过于宽松,无法有效消除错误样本。为了弥补这一差距,本文引入了原子树操作模型 (ATOM),这是一个将数据分解为功能单元 ($f(x)\rightarrow y$) 的框架。 ATOM 将良性操作数 $x$ 扰动与致命操作符 $f$ 扰动区分开来。前者被积极的过滤不必要地丢弃,而后者则通过宽松的过滤。我们的实验揭示了双重解离:模型对操作数扰动具有鲁棒性,但在操作数扰动下崩溃。通过优先考虑运算符而不是激进的操作数精度,我们的 ATOM 合成数据优于严格的基线(例如,比 LIMA 增益 +3.1%),这表明运算符多样性比操作数精度更重要。我们的代码可在 https://github.com/Lut-hub/ATOM 获取。