论文

MuTSE:人机交互多用途文本简化评估器

MuTSE: A Human-in-the-Loop Multi-use Text Simplification Evaluator

模型评测评测方法与指标

摘要

随着 大语言模型 (LLM) 在文本简化中变得越来越普遍,在不同的提示策略和架构中系统地评估其输出仍然是 NLP 研究和智能辅导系统 (ITS) 中的关键方法挑战。由于缺乏用于比较文本分析的结构化、可视化框架,开发强大的提示常常受到阻碍。虽然研究人员通常依赖静态计算脚本,但教育工作者却受到标准对话界面的限制——这两种范式都不支持对提示模型排列进行系统的多维评估。为了解决这些限制,我们引入了 \textbf{MuTSE}\footnote{项目代码和演示已在以下匿名 URL 上供同行评审。 https://osf.io/njs43/overview?view_only=4b4655789f484110a942ebb7788cdf2a,一个交互式人机交互 Web 应用程序,旨在简化对任意 CEFR 熟练度目标中 LLM 生成的文本简化的评估。该系统支持并发执行$P \times M$提示模型排列,实时生成综合比较矩阵。通过集成带有线性偏差启发式 ($λ$) 的新型分层语义对齐引擎,MuTSE 可以直观地将源句子映射到简化的对应句子,减少与定性分析相关的认知负荷,并为下游 NLP 数据集构建提供可重复的结构化注释。