论文
XYEval:代理商对不好的建议说“是”
XYEval: Agents say yes to bad advice
摘要
用户和人工智能代理之间的有效沟通对于人类与人工智能的协作至关重要。 XY 问题是一个众所周知的沟通陷阱,人们询问他们尝试的解决方案而不是他们的实际问题。我们将先前的阿谀奉承评估扩展到代理环境中的 XY 问题,评估代理是否可以抵制用户看似合理但具有误导性的建议并传达他们的推理。我们引入了 XYEval,一个元评估框架,可以将现有基准转换为 XY 问题评估。我们评估了六个不同基准套件中的五个模型。在基准测试中,智能体在 XY 突变下遭受了较大的 XY 下降,相对下降高达 46.7%。通过 $\tau^2$-bench,我们进一步表明,当遇到需要详细解释才能批准更好的解决方案的迂腐用户时,代理性能会下降更多。我们的研究结果表明,当前的代理人在面对误导性建议时缺乏有效推理和沟通的能力。鼓励人们意识到 XY 问题的简单系统指令基线只能提供部分缓解。广泛的跟踪分析提供了关于这些 XY 下降如何以及为何在执行轨迹上发生的行为见解。我们的结果表明,缓解 XY 问题仍然具有挑战性,要求代理既能识别用户误导,又能清楚地传达潜在问题。