论文
LatentMD:LLM 生成的文本中 Markdown 边界失败的基准测试
LatentMD: Benchmarking Markdown Boundary Failures in LLM-Generated Text
摘要
大语言模型 (LLM) 越来越多地生成 Markdown,供渲染器、代理、代码提取器和结构化下游管道使用。然而,现有的评估经常将内容质量与格式遵循混为一谈,从而导致 Markdown 边界失败的衡量不足。我们引入 LatentMD,这是一种基准和评估协议,用于诊断 LLM 生成的 Markdown 中的 CommonMark 级栅栏边界故障。 LatentMD 将内容正确性与边界正确性分开,从而能够检测内容正确但边界破坏的输出。该基准测试包含 4,179 个提示和一个用于对任意模型输出进行评分的 CLI。在 9 个 LLM 和大约 37,600 代中,我们发现 Markdown 边界故障很普遍:38.0% 的有效主网格输出内容正确但边界被破坏,在未指定的提示和小型人工编写的验证集中存在大量边界破坏。消融表明,失败主要是由同族对称分隔符冲突驱动的,而不是单独嵌套,提示提示只能部分缓解失败,并且可以推广到 Python 三引号文档字符串,而 JSON 作为非对称分隔符控件仍然保持稳健。 LatentMD 为解析器敏感的 LLM 评估提供了可重复的诊断目标。