论文
HSS-Synth:LLM的人文社会科学数据合成
HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMs
摘要
高质量、多样化的数据对于 大语言模型 (LLM) 至关重要,但仍然稀缺且成本高昂。数据合成是一种可行的替代方案,并且在封闭任务上取得了成功,但人文和社会科学 (HSS) 却被忽视了,而且它们的开放性本质使得合成具有挑战性。我们超越了以往以能力为中心、碎片化的尝试,采用以主题为中心的范式,定义了第一个涵盖14个主流领域的HSS域系统,并推出了第一个HSS数据合成管道HSS-Synth。 HSS-Synth包括:(1)通过多步过滤和法官评估的文本细化从网络语料库构建种子文档; (2)指定“需求+角色”,将种子文档反向翻译为多样化但忠实的指令,并进行严格的问答对齐检查; (3) 通过教师强制应答打破 LLM 应答限制,该应答在应答生成期间提供种子文档以锚定语义、减少幻觉并保持语气和完整性。 HSS-Synth 生成 237k 个高质量、多样化的指令调优样本,这些样本在 16 个基准测试中优于 14 个领先基线。经过微调的 Qwen3-8B-Base 设置了新的 SOTA,并接近官方 Qwen3-8B,提高了人类偏好和知识能力,而无需性能跷跷板。大量实验证明了 HSS-Synth 的稳健性和可转移性。我们的代码可在 https://github.com/pengr/HSS-Synth 上公开获取。