论文

LLM-as-Judge用于无人机巡检中电力线分割的语义判断

LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection

模型评测模型能力评测

摘要

在无人机上部署用于自主电力线路检查的轻量级分割模型面临着严峻的挑战:在与训练数据不同的现实条件下保持可靠的性能。尽管 U-Net 等紧凑架构能够实现实时机载推理,但它们的分段输出在不利环境中可能会出现不可预测的退化,从而引发安全问题。在这项工作中,我们研究了使用 大语言模型 (LLM)作为语义判断来评估无人机模型产生的电力线分割结果的可靠性的可行性。我们没有引入新的检查系统,而是形式化了一个看门狗场景,其中板外 LLM 评估分段覆盖并检查是否可以信任这样的判断,使其行为一致且感知连贯。为此,我们设计了两个评估方案来分析法官的可重复性和敏感性。首先,我们通过使用相同的输入和固定提示重复查询 LLM 来评估可重复性,测量其质量得分和置信度估计的稳定性。其次,我们通过引入受控的视觉损坏(雾、雨、雪、阴影和阳光)并分析法官的输出如何响应分割质量的逐渐下降来评估感知灵敏度。我们的结果表明,LLM 在相同条件下产生高度一致的分类判断,同时随着视觉可靠性的恶化而表现出适当的置信度下降。此外,即使在充满挑战的条件下,法官仍然会对感知线索(例如丢失或错误识别的电源线)做出反应。这些发现表明,在受到仔细约束时,LLM 可以作为可靠的语义判断,用于监控安全关键型空中检查任务中的分段质量。