论文

LOGIC:航电系统变更意图与影响分析的 LLM 基准

LOGIC: An LLM Benchmark for Intent-Grounded Change Impact in Aerospace Electrical Systems

模型评测基准与评测资源

摘要

航空航天电气设计修订可以包含多个真正的更改,尽管工程请求可能只授权其中的一个子集。因此,传播每个检测到的差异可能会产生过于广泛的影响报告。我们提出了 LOGIC,一个受控的基准和评估框架,其中本地可部署的语言模型在通过类型化的电气可追溯性图传播选定的更改之前将请求置于确定性候选更改清单中。这种分离允许将候选选择错误与下游传播错误区分开。 LOGIC包含168个场景,其中144个选择案例和24个弃权案例。我们针对意图不可知、词汇和结构化证据方法评估了三个 7--8B 模型,并具有预言根上限。在 96 个明确锚定的选择案例中,仅门结构化证据的候选 F1 为 1.0000,而 token 词汇匹配的候选 F1 为 0.9677。在 12 个关系释义案例中,token 词汇 F1 为 0.1772,仅门 F1 为 0.0000,而大语言模型为 0.5000--0.6400。随着候选清单从 4 个变化增加到 64 个变化,模型基础会降低,而当在大约 1K 到 100K 节点的图表上重播冻结选择时,受影响的元素和类型路径准确性保持相对稳定。严格的证据门控可以抑制误报,但可以消除正确的语义选择。探索性空证据弃权策略将所有三个模型的严格弃权准确率提高到 0.6667,并将不安全报告率降低到 0.1667,同时将应诉案件覆盖率降低 16.0--27.1 个百分点。对于每个模型,六个冲突请求中有四个仍然不安全。当无法可靠地确定意图时,这些发现支持将文字证据和语言模型推理与工程审查相结合。