论文
用于文本到 JSON 学习的基于源的数据生成
Source-Grounded Data Generation for Text-to-JSON Learning
摘要
从财务档案到临床记录,传统行业严重依赖冗长的非结构化文档来存储高价值信息。可靠地将这些信息提取为结构化的、机器可读的表示形式是使自动化系统可以访问内容的关键先决条件。 JSON 是此类结构化提取的自然目标,但构建可靠且可扩展的文本到 JSON 训练数据仍然具有挑战性。为了解决这一差距,我们提出了 STAGE(基于电子表格的文本到 JSON 工件生成),这是一种基于源的数据生成管道,它通过使用 LLM 进行可扩展合成来构建报告和 JSON 模式,同时根据底层电子表格验证 真值 值。对 STAGE-Eval(我们基于源的基准测试,具有 851 个示例测试集)的评估表明,STAGE 生成的训练数据比现有方法更强。这将 Qwen3-4B 的精确匹配率从 31.37% 提高到 74.27%,数值准确度从 45.46% 提高到 90.69%。