论文
言外之意:大语言模型能否发现文本背后的问题?
Reading Between the Lines: Can LLMs Discover the Question Behind the Text?
摘要
本文介绍了“问题考古学”,这是一项具体的评估任务,重点是推断单一的、真实的“起源问题”,从而激发了完整文本的创作。与针对任何看似合理的问题的问题生成或模拟话语级行为的话语框架不同,我们的任务评估模型对作者意图的把握。我们提供了一个新的委托文本数据集,以及他们最初的研究问题和可能的干扰因素。我们对 Gemini Flash 和 Pro 等专有模型以及 Mistral 和 Qwen 等开源模型的评估表明,这项任务取得了重大进展,新版本的表现优于早期版本,而基于 BERT 的模型表现不佳。值得注意的是,我们的研究结果表明,目前的大语言模型在这项任务上的表现超越了人类,这表明对作者意图的深入理解。这种能力对于人工智能在需要对人类交流进行细致入微的解释的任务中的作用具有重要意义。因此,我们的工作为未来模型提供了一个新的框架和具有挑战性的基准。