论文
抱歉,我无法帮助盲文:揭示最先进的辅助功能 LLM
I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs
摘要
大语言模型 (LLM) 在许多语言任务上表现强劲,但它们在结构受限、可访问性关键的模式(例如盲文)中的能力仍不清楚。我们使用人工注释的数据集在双向韩语盲文翻译上评估最先进的 LLM。尽管期望多语言、指令调整的模型可以通过文本表示推广到盲文,但我们发现输出始终很差、不稳定,并且与人类判断存在很大差异。这些结果表明缺少盲文感知标记化以及韩语和盲文模式之间的弱对齐。相比之下,在相同数据上的小模型(T5-small)的监督 微调 比零样本产生了大而稳定的增益,并提示了跨标准指标(SacreBLEU、ChrF++、CER、BLEU、ROUGE-L、METEOR、CIDEr)的 LLM 基线。我们的研究结果揭示了当前 LLM 的系统局限性,并证明了适度的特定任务监督的有效性。