论文
用于评估和调整 大语言模型 问题澄清能力的三代理框架
A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models
摘要
大语言模型 (LLM) 越来越多地部署在交互式系统中,其中准确理解用户意图至关重要。此类系统的一个关键功能是有效地澄清问题,特别是当用户查询不明确或不明确时。本文介绍了一种新颖的三代理框架,用于稳健评估 LLM 参与澄清对话的能力。我们的框架包括三个不同的基于 LLM 的代理:(1)问题澄清代理(QCA),即正在评估的系统,负责识别歧义并提出澄清问题; (2) 响应代理 (RA),旨在模拟人类用户响应,可能包括不相关或具有挑战性的回复; (3) 评估代理 (EA),即 LLM 作为法官,它根据一组全面的指标评估对话的质量。作为示例,我们详细介绍了供应链领域中的合成数据生成方法。我们提出了评估歧义处理、问题质量、对话效率、语言适当性和最终意图一致性的指标。我们还简要讨论了 EA 针对人类判断的验证。这项工作提供了一种结构化方法来对会话 LLM 应用程序进行基准测试、验证和改进澄清功能。