论文
LLM知道该问什么、何时问吗?多轮信息获取评测
Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking
摘要
当用户问题欠明确时,一个有能力的模型应认识到自身上下文不足、识别缺失的信息、主动询问,并且只有在所获信息能确定唯一答案后才作答。我们将多轮信息获取形式化为求解k-欠明确约束满足问题,其中k是共同确定目标所需的变量数量,因而度量信息缺失程度。我们将该形式化实例化为MT-InfoSeek,一个受控评测套件,包含5,251个问题与9,006个任务实例,覆盖数学、逻辑、生物、医学与通识。我们从三个轴评估模型:问什么、何时问,以及所获信息如何影响最终答案。随着欠明确程度增加,各模型、各领域的性能都下降。模型能识别需要额外信息,但会低估所需信息的量:在k=2的逻辑问题中,模型低估信息缺失程度的频率约为高估的四倍。模型也未能识别最小充分查询集,即便给出真实k也仅略有改善,且常在获取足够信息之前就停止。在具有有序依赖的任务中,即使模型最终获取了全部必要信息,错误的查询顺序也会降低最终准确率。我们通过最终充分性直接度量信息获取——记录所获信息是否在独立于答案生成的情况下确定了目标。这一分离揭示了仅凭最终准确率无法捕捉的模型差异,并表明多轮信息获取能力不同于答案生成能力,且未被当前LLM评测所度量。
