论文
TEA-Bench:工具增强情感支持对话智能体的系统性基准测试
TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
摘要
情感支持对话不仅需要情感表达,还需要扎实的工具性支持来提供值得信赖的指导。然而,现有的 ESC 系统和基准主要关注纯文本环境中的情感支持,忽视了外部工具如何在多轮情感支持中实现事实基础并减少幻觉。我们推出了 TEA-Bench,这是第一个用于评估 ESC 中工具增强代理的交互式基准,具有真实的情感场景、MCP 风格的工具环境以及共同评估情感支持的质量和事实基础的流程级指标。对九个大语言模型的实验表明,工具增强通常可以提高情感支持质量并减少幻觉,但其收益在很大程度上取决于能力:较强的模型更有选择性和有效地使用工具,而较弱的模型则只能略微受益。我们进一步发布了 TEA-Dialog,这是一个工具增强的 ESC 对话数据集,发现监督微调改善了分布内支持,但泛化能力较差。我们的结果强调了工具使用在构建可靠的情感支持代理方面的重要性。
