论文
AI助手过度协助
AI Assistants Overassist
摘要
大语言模型 (LLM) 越来越多地被用作导师和思想伙伴,帮助用户推理问题。虽然人工智能助手的指导可以支撑思维并促进学习,但这种好处取决于它们如何提供帮助——例如,太早或太频繁的干预可能会阻碍真正的学习和认知参与。然而,人工智能系统在解决问题期间如何引导干预决策仍然知之甚少。在这里,我们介绍 Int-Bench,一个基于模拟的基准,用于评估学习过程中的 LLM 干预。 Int-Bench 模拟“学生”解决问题,而“老师”监控学生的推理并决定是否、何时以及如何干预。我们在代码调试、数学和脑筋急转弯这三个领域对 LLM 教师的干预频率和时间安排以及干预对立即任务成功和推广新问题的影响进行了评估。我们还将 LLM 与人类进行比较,发现 LLM 比人类更频繁、更早地进行干预。此外,与人类相比,他们倾向于提供完整的解决方案,而不是有针对性的提示。这些发现表明,当前的 LLM 助手通常会针对短期成功进行优化,而不是支持更深层次学习和长期成功所需的推理过程。