论文

博弈论驱动的多智能体框架缓解语言模型幻觉

Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination

模型训练合成数据

摘要

轻量大语言模型在基于规则的科研领域的应用仍受限于其模仿语言模式而非复现公理化推理的倾向——导致频繁幻觉。这里我们显示G-Frame——整合贝叶斯与团队博弈原理的自适应多智能体框架——建立高质量数据合成与模型训练的自动化闭环。通过经结构化推理强制内化领域约束,我们合成了363,045条思维链与199,589对问答的专门语料。所得7B模型OmniChem在自建基准与ChemBench上达到与GPT-4o mini相当的表现,同时幻觉较其基座架构降低79.46%。我们进一步展示OmniChem在分子设计与合成规划上的高级能力。本工作确立了利用自适应多智能体克服固有推理缺陷的可扩展范式——为加速专门科学领域的知识发现提供可行路径。

博弈论驱动的多智能体框架缓解语言模型幻觉:论文配图
图 1: G-Frame 通过两种不同的模式实现自适应策略:(i) 团队游戏和 (ii) 贝叶斯游戏。 b.该条形图显示了截至 2025 年 5 月 15 日在 Hugging Face 上指定有化学标签的开源数据库的数量。值得注意的是,这些数据集的很大一部分包含无效条目或属于其他领域;因此,真正可用的化学数据量少于报道的数量。 c、d、e。展示了使用 G-Frame 构建 OmniChem 的工作流程,由三个模块组成:数据预处理、数据合成和模型训练。 f.显示了用于预训练的期刊语料库的组成。