论文

Hy-MultiTurn:深度多轮对话理解的六维基准

Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

模型评测基准与评测资源

摘要

与聊天机器人和代理进行长时间运行的多轮交互现在很常见,正确的响应通常取决于记住早期的​​细节、跟踪后来的修订、识别预期的对象或指示对象,以及在不满足所需条件时停止采取行动。现有的多轮基准通常涵盖短交换,并且没有充分评估长时间多轮交互中的这些能力,特别是在中文中,同时对模型如何以及为何失败的了解有限。为了解决这些局限性,我们分析了真实的聊天机器人故障,以确定六种重复机制,并使用它们在 Hy-MultiTurn(深度多轮对话理解的中国基准)中定义六种受控评估模式。这六种模式评估约束记忆、精确执行、约束综合、对象定位、动作抑制和参考解析。在这六种模式中,我们构建了 209 个受控任务,涵盖 12-76 个回合,其中对话长度、不相关主题的干扰和口语措辞增加了进一步的难度。对 22 种前沿模型配置的评估表明,Hy-MultiTurn 具有广泛的挑战性,因为即使是最强的整体配置 GPT-5.5,也仅以 41.1% 的响应满足所有要求,并且没有模型在所有六种模式下表现最好。