论文
PRIME:评估LLM在不兼容指令下的提示消解
PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs
摘要
大语言模型(LLM)常遇到冲突提示——但当前指令遵循基准孤立评估这些元指令——限制了对模型如何处理冲突指令的洞见。我们介绍PRIME(不兼容元指令下提示消解评估)框架——分析LLM在被给予冲突指令时的行为。PRIME有意生产跨响应长度、输出格式与推理的校准冲突——以确定性行为分类法为模型响应分类。我们在平衡与自然分布两种设定下评估五个指令微调开放权重LLM。分析得出的结论是:冲突类型比模型规模更显著地影响行为——且不同冲突类别有不同失败模式。我们的发现强调发展冲突感知的价值——并提示LLM遵循指令的能力无法仅经孤立约束评估。
