论文
大语言模型对爱沙尼亚语整篇文档简化的评估
Document-Level Text Simplification in Estonian Using Large Language Models
摘要
文档级文本简化涉及超越句子内部编辑的转换,解决话语连贯性、照应解析和跨段落一致性。尽管高资源语言的句子级简化取得了进展,但形态丰富、资源匮乏的语言(例如爱沙尼亚语)的文档级简化在很大程度上仍未得到探索。这项研究对五种用于爱沙尼亚语文档级简化的最先进的多语言大语言模型 (LLM) 进行了综合评估。研究了三种提示策略:单遍生成、基于管道的模块化Agent和指南增强管道。该评估框架集成了评估可读性、语义保留和话语连贯性的自动指标,以及结构化的手动注释协议。研究结果表明,Gemini-2.0 和 LLaMA-3.3 产生的输出具有接近母语的流畅性和较强的含义保留,而其他模型则显示出明显的语法和语义限制。这项工作贡献了新颖的文档级 连贯性指标、基于证据的提示策略以及可重复性的公开可用资源。
