论文

代码生成中 大语言模型 的任务放弃

Task Abstention for Large Language Models in Code Generation

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 彻底改变了自动代码生成。然而,一个严重的问题是所谓的“幻觉”,即 LLM 可能会生成看似合理但功能不正确的代码。在本文中,我们研究任务放弃问题,即确定给定的 LLM 是否应该放弃执行特定的代码生成任务以避免可能的幻觉。我们的方法以基于多重假设检验原则的校准弃权规则为特色。该规则通过代码执行结果评估生成一致性,使其能够处理语义等效代码的语法多样性,而无需依赖预言机测试用例或外部数据库。我们证明,我们的方法为其弃权决定提供了严格的、无分配的理论保证。我们使用几个开源代码 LLM 在基准数据集上评估我们的方法。结果表明,与现有技术相比,我们的方法允许生成模型更准确、更有效地识别和避免引起幻觉的任务,从而为更安全、更稳健的代码生成提供可靠的机制。