论文
FASE:用于代码质量的快速自适应语义熵
FASE: Fast Adaptive Semantic Entropy for Code Quality
摘要
多代理代码生成通过模拟人类软件工程生命周期,为自主软件开发提供了一种有前途的范例。然而,系统可靠性仍然受到 LLM 幻觉和交互代理之间的错误传播的阻碍。虽然语义熵提供了一种在没有 真值 答案的情况下量化不确定性的原则性方法,但当前的方法通常依赖于昂贵的 LLM 驱动的等价检查。在这项工作中,我们介绍了快速自适应语义熵(FASE),这是一种基于结构和语义相异图的最小生成树来近似功能正确性的新颖度量。对 HumanEval 和 BigCodeBench 的评估表明,在使用 Qwen3-Embedding-8B 模型时,FASE 通过 LLM 蕴涵优于最先进的语义熵,与 真值 测试用例的 Pass@1 相比,Spearman 相关性平均提高了 25%,ROCAUC 分数提高了 19%。此外,通过消除昂贵的 LLM 驱动的等价评估,FASE 产生的计算开销可以忽略不计,仅需要传统语义熵方法的大约 0.3% 的运行时成本。这些结果使 FASE 成为一种实用、经济高效的解决方案,用于优化现实世界多智能体工作流程中的不确定性量化。