论文
面向多模态核监管文档多跳推理的LLM引导规划
LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents
摘要
审阅核监管文档需要跨数万页的多跳推理——判断依赖跨多章汇集的证据。我们把该任务框定为规划:基于LLM的智能体观察已收集的证据——选择下一个要检查的文档片段——在证据充分时停止。智能体在无向量文档树上用浏览、阅读与搜索工具运作——并维护动态知识图谱(KG)作为状态。在NuScale最终安全分析报告(FSAR)文档的200题基准上——系统达81.5%准确率——RAGAS Faithfulness 0.93。主导性能因素是规划:对照使用相同文档树但无状态条件动作选择的PageIndex——差距+38.0pp(43.5%到81.5%,p<0.001)。系统还超越LightRAG(73.0%,p<0.05)、HippoRAG(70.5%,p<0.01)与GraphRAG(49.5%,p<0.001)——并在无离线索引下匹敌RAPTOR(75.5%,p=0.11)。边推断增加2.8倍成本而不提升准确率;我们保留它作为可追溯模块。7,391条推断边中——3条Violates边(0.04%)把范围边界(Q058)与部分合规(Q176)标记为人类审查者可审计的带类型注释。
