论文

当机器说话时:将机器原生符号集成到预训练 大语言模型 中的统一生成框架

When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models

模型训练监督微调与指令调优

摘要

许多现实世界的人工智能系统使用离散的机器本机符号而不是自然语言来表示实体、行为和结构化信息。虽然这些表示形式很紧凑并且保留了任务相关的结构,但它们位于预训练的 大语言模型 (LLM) 的语言标记空间之外,从而在语言建模和结构化预测之间形成了根本鸿沟。我们引入了 UniLang,这是一个统一的生成框架,它通过扩展预训练的 LLM 将机器原生符号与自然语言标记一起视为一流的生成单元来弥合这一鸿沟。 UniLang 通过扎根的机器本机表示扩展了 LLM 的词汇表和嵌入空间,使文本和符号标记能够在单个自回归目标下联合建模和生成。这种统一的接口允许预训练的 LLM 直接对机器本机表示进行操作,而不需要将它们表达为自然语言或依赖于特定于任务的架构。我们在两个结构不同的任务(顺序推荐和法律先例预测)上评估 UniLang,涵盖不同的领域和类型的结构化预测。在这两项任务中,UniLang 始终优于强大的基线,展示了将预训练的 LLM 扩展到语言之外的路径,并将其用作异构机器本机表示的通用生成建模骨干。