论文
BrailleBench:考察大语言模型的多准则盲文理解
BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models
摘要
尽管大语言模型(LLM)正在成为获取知识和计算辅助的媒介,它们的能力也应当以同样的方式惠及弱势群体。然而,现有AI系统对盲人和聋盲用户是否足够包容仍不清楚——这些用户需要通过盲文获取同等功能,而盲文的指示符、缩写形式和数字表示为模型理解提出了独特要求。为此,我们提出BrailleBench,一个从不同准则评估LLM盲文理解能力的基准。BrailleBench对齐了来自五个数据集的5,570个实例,涵盖数学、常识和多跳问答,跨越英语与盲文一级和二级。我们设计了不同配置,以考察系统能否理解盲文书写的内容、用盲文表达答案,以及完成端到端的盲文交互。为确保质量并防止评估偏差,该基准通过一个确定性的、经专家审核的流水线构建,使用自建的盲文工具包(Braille Toolkit),不使用任何由LLM生成的数据实例。我们从多个方面评估了六个代表性LLM。结果显示,印刷英语能力与盲文可及性之间存在持续差距。盲文理解与表达是不对称的,二级盲文在输入侧相较一级尤其脆弱,而完全用盲文提出的请求会进一步降低性能。这些实验观察为未来盲文AI系统的开发提供了有价值的指导。BrailleBench的所有相关资源均已公开,供未来研究使用。