论文
评估大语言模型的可读性:推理和小样本提示的作用
Assessing Readability with LLMs: The Role of Reasoning and Few-Shot Prompting
摘要
可读性评估对于为教育、医疗保健和信息检索领域的目标受众定制文本至关重要。然而,传统的可读性公式很难跨流派和语言推广,而监督机器学习模型依赖于稀缺的、特定领域的注释语料库,限制了它们的适用性——特别是对于资源较少的语言。大型语言模型 (LLM) 提供了一种高度可扩展的多语言替代方案,不需要特定于任务的训练,但高级提示策略对其性能的影响仍未得到充分研究。在本文中,我们对用于多语言可读性评估的各种开源大语言模型进行了系统基准测试,重点是预测教育框架所需的离散可读性水平。除了英语之外,我们还评估了资源较少的语言斯洛文尼亚语的方法,以确定大语言模型在资源匮乏的环境中是否仍然有效。具体来说,我们研究了显式推理的影响,证明思想链(CoT)提示和推理导向模型比直接回答有显着的改进。此外,我们对少样本上下文学习的探索表明,与零样本设置相比,为每个类别仅提供一个标记示例(1 样本)可以显着提高预测质量,而额外的示例会带来收益递减。通过将这些方法与传统的无监督指标和最先进的监督基线进行全面比较,我们确定了开箱即用的大语言模型作为强大的跨语言可读性评估器的可行性。