论文
释义引起的输出模式崩溃:当 LLM 在语义等效输入下中断字符时
Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs
摘要
当请求的实质性内容被重写时,大语言模型 是否仍然按照原始任务要求的格式回答?我们发现它们通常不会,即使在零温度下也是如此。在对 5 个紧凑的 2025 时代 LLM 和四种任务类型进行 150 个查询评估时,我们观察到一种系统性故障模式,我们称之为提示变体输出模式崩溃:当封闭式提示要求裸标签或单个选择标记时,保留内容的提示变体可以将模型推入会话散文中,所请求的格式消失,并且精确匹配评估管道默默地误判结果。为了使这一点变得可测量,我们发布了 PARACONSIST,这是一个包含 150 个基本查询的 900 个提示基准,每个查询有 5 个词汇、句法和语义扩展提示变体,以及一个语义一致性得分,它将提示变体稳健性分解为答案一致性、句子 BERT 语义相似性和长度稳定性。在全字答案集匹配下,只有约 22% 的封闭形式变体响应在其输出中保留 真值 标签,而约 78% 完全偏离答案空间。在我们的池中,崩溃的主要预测因素是任务结构而不是模型身份,模型差异由答案一致性和长度稳定性共同承担。因此,稳健性审核应跟踪响应模式保留,将其与答案准确性一起作为一流的可靠性目标。