论文

基于 LLM 的 Web 可访问性修复:检测、修复和成本的实证研究

LLM Based Web Accessibility Repair: An Empirical Study of Detection, Remediation, and Cost

模型评测模型能力评测

摘要

确保大规模的网络可访问性仍然具有挑战性,因为基于规则的工具提供的覆盖范围有限,而手动修复成本高昂且容易出错。本文评估了基于 大语言模型 的代理,特别是 Kimi K2.5,与基于规则的方法相比,用于自动可访问性检测和修复。对于检测,LLM 的性能与基于规则的工具相当,F1 约为 0.65,语义理解能力强,F1 为 0.83,但语法和布局相关违规的可靠性较低。在修复方面,LLM 生成的修复在超过 99.7% 的情况下在语法上有效,并提高了 80.2% 实例的可访问性合规性,将每个文件的违规次数从 3.98 次减少到 1.7 次。然而,只有不到 26% 的案例得到完全解决,并且大约 30% 的补丁引入了结构性变化。我们还发现,基于迭代代理的细化使计算成本增加了 52%,API 使用量增加了 1.64 倍,而没有改善补救结果。这些发现表明,虽然 LLM 对于部分可访问性修复有效,但不足以实现完整可靠的修复。可扩展的可访问性解决方案需要将 LLM 功能与基于规则的验证和约束感知纠正机制相结合的混合方法。