论文
通过语言模型的证据保留所有权路由进行字级文本分解
Word-Level Text Unmixing via Evidence-Preserving Ownership Routing with Language Models
摘要
当归因元数据丢失时,来自多个源的文本可能会交织成单个序列,例如重叠的语音转录、文档阅读流或并发的智能体流。我们将这一挑战形式化为单词级文本分解:给定交错的词汇流和源计数 K,恢复原始源序列,同时准确保留每个单词的出现及其在源内的顺序。使用LLM直接生成分离的文本可能会省略、重复或产生幻觉单词,从而违反了这一精确重建目标。因此,我们提出证据保留所有权路由(EPOR),它将源所有权预测与重建分离。 EPOR 采用因果LLM来预测以混合流和先前路由决策为条件的规范所有权路由。在推理时,完成安全的约束解码与确定性索引重建相结合,产生结构上有效的 K 源分区,将每个观察到的事件保留一次。我们还介绍了 UNMIXBENCH,涵盖受控合成混合物、来自 AMI 和 ICSI 的时间戳派生语音、来自 ReadingBank 的布局派生文档流以及模拟并发数字输出。在五个评估轨道中,4B EPOR 模型在微调基线中实现了最低的平均最小排列字错误率,相对于紧凑源阵列生成,五轨道平均值降低了 22.3%,并与零样本前沿LLM保持竞争力。这些结果表明,当充分观察到词汇证据时,将所有权推断与词汇再生分开可以提供直接生成的可靠替代方案。
