论文

与万事通的 GPT 或爱猜测的克劳德交谈?修复如何揭示 LLM 中不可靠的多轮行为

Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs

模型评测模型行为与机制分析

摘要

修复是解决人与人对话中问题的重要资源,但在人与 LLM 交互中仍未得到充分探索。在本研究中,我们研究了 LLM 如何参与围绕可解和不可解数学问题的多轮对话中的修复交互过程。我们检查模型是否自行启动修复以及它们如何响应用户启动的修复。我们的结果显示了不同模型之间的巨大差异:反应范围从几乎完全抵抗(适当的)修复尝试到高度敏感和容易操纵。我们进一步证明,一旦对话超出单轮,模型行为就会变得更加独特且跨系统的不可预测性。总体而言,我们的研究结果表明,每个测试的 LLM 在维修过程中都表现出其自身的不可靠性特征。