论文
超越一种路径:评估和增强交互式 LLM 代理中的发散思维
Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents
摘要
发散思维是创造力的核心维度,但现有的 大语言模型 (LLM) 评估将其视为单轮文本生成,未能捕捉智能体如何通过迭代交互进行推理。为了解决这个问题,我们引入了 MUTATE,这是一个交互式基准测试,旨在评估两个级别的代理发散思维:路径级别,代理发现到达同一目标的多个替代路径,以及操作级别,其中单个操作需要非典型的机制转换对象使用。与仅成功评估不同,MUTATE 对完成的路径和偏离路径的尝试进行评分,捕获传统成功率丢弃的不同推理。我们对前沿 LLM 的实验揭示了现有框架中的结构性盲点:当面临即时收敛压力时,它们往往会陷入即时行动固定,无法改善行动层面的分歧。为了克服这个问题,我们提出了 ReDNA,它将无约束的发散候选生成与收敛约束选择分开。 ReDNA 在两个分歧水平上都显着优于先前的方法,并且可以有效地推广到外部创造力环境。我们还确认其成功源于弹性发散推理的质的增强,而不是简单的环境探索。