论文

IFHierBench:面向大语言模型的层级化指令遵循

IFHierBench: Hierarchical Instruction Following for Large Language Models

模型评测基准与评测资源

摘要

指令遵循能力对在真实应用中部署大语言模型至关重要,下游组件依赖输出满足特定约束。现代部署日益倾向于在单次LLM调用中完成整个任务,由一个提示规定分层的输出,其整体产物、结构性章节和嵌套字段都必须分别满足具体约束。现有指令遵循基准将约束集合视为统一作用于响应的扁平列表,因此无法把检查限定到输出的特定章节。我们提出IFHierBench,一个层级化指令遵循基准,包含600个提示,按四个约束树深度分层并覆盖35种不同约束,每个提示配有一个确定性检查器,在每个作用域上验证约束满足情况。对七个领先的专有与开放权重模型的评估发现,即便最强的模型也仅勉强超过50%的提示级准确率,且准确率随约束深度增长急剧下降。可靠地遵循嵌套约束对当前LLM而言仍是显著差距,这促使未来研究开发在更细粒度上考虑约束遵守的训练方法,以获得更好的指令遵循能力。

IFHierBench:面向大语言模型的层级化指令遵循:论文配图
图 1:分层指令示例如下:数字标记约束深度,深色框表示更深的范围。