论文

规范不足并不意味着不连贯:编码模型中语义崩溃的风险

Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models

模型评测鲁棒性、公平性与可信度评测

摘要

当任务描述清晰准确时,大语言模型 (LLM) 在生成代码方面变得越来越有效。然而,在实践中,用户提供的任务描述通常是不明确的、不完整的或矛盾的,导致预期程序行为的关键方面未得到明确说明。在这种情况下,多种行为上不同的解释可以同样很好地满足描述,但在语义上在重要/影响用户意图的方面有所不同。研究人员经常假设的一个自然期望是,迅速的规范不足会表现为不连贯:当多次询问时,LLM 会产生多个语义上不同的实现,反映任务描述的模糊性。在本文中,我们挑战这一假设。我们发现 LLM 经常崩溃到对任务描述的单个错误解释上,始终生成连贯但行为不一致的代码。我们将这种故障模式称为“有害语义崩溃”,并发现它影响了 MBPP 中超过 10% 的任务、HumanEval 中的 3% 以及 LiveCodeBench 中的 32%,所有基准测试都假设是明确指定的。通过故意在基准提示中注入规格不足问题,该比率上升至 5 倍以上,暴露了消歧和正确性估计技术中的基本盲点,这些技术依赖于不连贯性作为提示规格不足的代理。