论文

利用语言模型对古文献进行文本修复

Text Restoration of Ancient Documents with Language Models

模型推理解码与生成控制

摘要

目的 - 本研究调查使用语言模型恢复损坏的古代手稿中因物理缺陷而导致的缺失文本的可行性。方法论——该研究提出了不同的场景来复制现实世界的条件。不同架构的语言模型根据其对每种场景的适用性来应用。我们还提出了几种解码策略,以进一步提高性能并解决空白边界和模型标记化方案之间的差异。研究结果 - 结果表明,这些文档的文本恢复不能完全自动化,但它可以作为协助古文字学家工作的有用工具。模型性能差异很大,具体取决于需要恢复文档的哪个结构部分以及丢失文本的字符长度是否可用。原创性 - 这是第一个研究和分析模型在公式化和非公式化内容上的性能以及手稿修复中的空白长度意识的影响。两者都是古文字学家的手工修复工作中反复出现的挑战。通过对不同环境下不同模型性能的系统比较和定性和定量分析,本研究为开发支持古文字学家的辅助工具提供了指导。