论文
对标提升LLM国家标准文件规则强化审查
Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents
摘要
大语言模型 (LLM) 越来越多地支持复杂的专业任务,但其在规则密集型文档审查方面的能力仍未得到充分评估。国家标准文件,例如中国 GB/T 标准,提供了一个具有代表性的测试平台:它们冗长、结构严密,并受到范围、术语、规范性措辞和横截面一致性的明确规则的约束。现有的基准侧重于领域知识和问题解答,很大程度上忽视了专业文档的内在质量审查。此类审查严重依赖人类专家,导致成本高昂且难以规模化。为了弥补这一差距,我们引入了 GB/T-Bench,这是第一个对国家标准文件进行结构化审查的基准。其 GB/T 审查分类法是一个层次结构,涵盖文档结构、范围对齐、规范模式、术语一致性和规范引用,具有 25 种可诊断错误类型。可控反例生成机制结合了确定性规则和受约束的 LLM 重写,将 488 个文档处理成 7,306 个可追踪的审阅错误实例进行评估。我们还开发了一种面向诊断的评估协议,要求错误位置、审查维度和错误类型以及文档级覆盖率指标的精确匹配。我们进一步提出GB/T-Reviewer,一个多智能体框架,将评审知识转化为专业技能,协调全局检查、针对性诊断、规则扫描和结果验证。对 14 个主流 LLM 的实验揭示了人类与 LLM 之间的巨大差距:最强模型仅达到 0.3280 CMCS,而专家模型为 0.6640。 GB/T-Reviewer 将最佳 CMCS 提高到 0.5094,显示了结构化技能协调对于规则密集型文档审核的价值。这项工作为标准化和其他高风险文档领域中值得信赖的人工智能铺平了道路。