TeXFix-Bench:基于实证故障的多格式LLM文档源码修复基准
TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair
摘要
科技写作依赖必须能够编译的标记源码:LaTeX、Typst和Markdown管线会因缺少分隔符、环境不匹配、导入损坏或包冲突而失败。现有文档修复评估用以特设编辑注入故障,缺乏实证故障模型。我们提出TeXFix-Bench,一个基于挖掘所得故障分类体系、面向LLM全源码文档修复的多格式基准。对来自TeX Stack Exchange、GitHub提交和包文档的局部化硬崩溃LaTeX故障进行的扎根理论研究(168个经核验故障,双人开放编码κ=0.34)得到了一个18类分类体系,并实例化为DocMut:覆盖三种格式的48个AST感知变异算子。三模型交叉基准显示,DocMut故障比相同种子上基于模式的变异难修复5.6-9.2个百分点;一项真实错误案例研究(88个人工崩溃,67.0%修复成功率)从下方界定了两组合成集。我们从743个开放许可种子构建了10,437个实例,在固定的零样本协议与提供商固定路由下评估七个LLM,共收集48,651次尝试,推理总成本约200美元。一个完整的6,613实例×7模型平衡矩阵证实了所有排名。固定引擎门控产生27.5个百分点的意向处理(intention-to-treat)编译差距(56.7-84.2%)。Typst明显难于LaTeX和Markdown。覆盖28,129个可编译修复的还原oracle显示,13.6-18.5%的可编译修复实质性改变了文档文本,且还原排名与编译排名分歧:编译率最低的模型在其成功修复中的内容还原最好。仅凭编译成功会高估修复质量。我们发布该分类体系、DocMut及全部评测活动产物。