论文

基于置信度门控的转导测试生成用于代码重排序

Confidence-Gated Transductive Test Generation for Code Reranking

模型推理推理验证与自校正

摘要

测试用例合成对于评估和排序大语言模型(LLMs)生成的程序至关重要。然而,构建高质量测试用例仍具挑战性,因为可靠的预期输出往往难以获得。我们提出了置信度门控转导测试生成(CoTT),首先使用高效的归纳过程,仅当归纳置信度较低时才调用转导生成。这种自适应设计在提升输出可靠性的同时,仅在必要时分配额外计算。在代码重排序基准上,CoTT在所有报告的指标上均优于现有基线方法,且相较于对每个输入都应用转导生成,降低了计算成本。这些结果表明,基于置信度的测试时计算分配在效率与效果之间提供了良好的权衡,仅需一个高效的LLM即可实现。