论文
SEQUOR:现实约束跟随的多轮基准
SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following
摘要
在对话中,有用的助手必须可靠地遵循用户指令,即使他们改进、修改或反驳先前的请求。然而,大多数指令跟踪基准测试都侧重于单轮或短多轮场景,而模型处理长范围指令跟踪任务的能力仍悬而未决。为了弥补这一差距,我们提出了 SEQUOR,这是一种用于评估长时间多轮对话中约束遵守情况的自动基准。 SEQUOR 由模拟角色驱动的交互组成,这些交互是根据从现实世界对话中提取的约束而构建的。我们的结果表明,即使遵循单一约束,随着对话时间的延长,指令遵循准确性也会持续下降,下降幅度超过 11%。当模型必须同时遵循多个约束时,这种下降会更大,从而使准确性降低 40% 以上。在对话的任意点添加或替换约束的场景中,模型准确度下降超过 9%。总而言之,我们的结果表明,当前的模型仍然难以在多轮对话中遵循用户指令,并提供了一种更好地衡量助手遵循指令的能力的方法。