论文

Loom:通过嵌入空间重加权,将诊断线索编织为自由文本共识

Loom: Weaving Diagnostic Strands into Free-Text Consensus via Embedding-Space Reweighting

模型推理推理验证与自校正

摘要

在现实世界的工业环境中部署 NLP 系统时,将嘈杂、相互冲突的文本假设聚合成可靠的共识是一个基本挑战。虽然整体大语言模型 (LLM) 代理为根本原因分析 (RCA) 等任务提供无限的表达能力,但它们受到上下文限制、复合幻觉和令人望而却步的推理延迟的困扰。传统的弱监督提供了统计严谨性,但在数学上仅限于离散类别。我们提出了 Loom,一个为现实世界的 RCA 部署的生成共识框架,它连接了这些范式。 Loom 通过将模块化启发式(动态填充特定事件实体、时间和指标的诊断模板)发出的开放式假设投影到连续的嵌入空间中来聚合它们,并使用基于迭代质心的重新加权算法解决冲突信号。由此产生的共识权重基于单个轻量级 LLM 合成步骤。根据 OpenRCA 基准评估,Loom 占据了准确性-效率 Pareto 前沿:它与 Bank 和 Market-2 上最先进的自主代理相匹配,并在 Market-1 和 Telecom 上进行跟踪,同时在所有四个数据集上每个事件使用单个 LLM 调用(更快 $\sim$26$\times$;使用 8B 参数合成器 $\sim$33$\times$)。我们讨论了我们的部署经验,重点介绍了在代理深度和推理延迟之间的权衡、冗余检测的负面结果以及确定性共识如何促进主题专家(SME)之间的信任方面吸取的经验教训。

Loom:通过嵌入空间重加权,将诊断线索编织为自由文本共识:论文配图
图1:Loom推论管道。不同的数据来源通过发布模板、针对具体事件的根本原因分析的方案诊断力来评估。这些产出经过语义嵌入和中子重新加权,以确定最可靠的共识,产生对各部分的重要加权和相似性图。最后,将大语言模型的原因综合起来,超越了排名的诊断产出,产生了一份具有凝聚力的驻地协调员评估最后报告。