论文

多一回合,少后悔:LLM 澄清政策基于后悔的多回合基准

One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies

模型评测基准与评测资源

摘要

模糊的用户请求使得澄清成为会话 LLM 助理的顺序决策问题:他们必须决定是否询问、询问什么、何时停止以及何时回答。我们引入了 RegretBench,这是一个多轮基准,它将澄清作为政策行为而不是孤立的问题质量进行评估。 RegretBench 提供了模糊性的隐藏意图表述,支持基于语义状态跟踪的自由形式交互,并引入了基于遗憾的目标,用于衡量模型相对于参考澄清策略损失了多少价值。开放域 QA 和产品推荐场景的实验表明,仅最终成功是不够的,因为具有相似精度的模型在效率、对用户行为的鲁棒性和停止决策方面可能存在很大差异。通过联合测量意图解析、交互成本、无效澄清和遗憾,RegretBench 揭示了模型的澄清是否有用且高效。我们的结果表明,有效的澄清需要的不仅仅是看似合理的问题:模型必须在正确的时间提出正确的问题,并在用户的预期含义明确后停止。