论文

IntentGrasp:意图理解的综合基准

IntentGrasp: A Comprehensive Benchmark for Intent Understanding

模型评测基准与评测资源

摘要

准确理解语音、会话和写作背后的意图对于开发有用的 大语言模型 (LLM) 助手至关重要。本文介绍了评估LLM意图理解能力的综合基准测试IntentGrasp。 IntentGrasp 源自跨越 12 个不同领域的 49 个高质量、开放许可的语料库,通过源数据集管理、意图标签上下文化和任务格式统一构建。 IntentGrasp 包含一个包含 262,759 个实例的大规模训练集和两个评估集:包含 12,909 个测试用例的 All Set 和包含 470 个用例的更加平衡和更具挑战性的 Gem Set。对 7 个系列的 20 个 LLM(包括 GPT-5.4、Gemini-3.1-Pro 和 Claude-Opus-4.7 等前沿模型)的广泛评估表明性能并不令人满意,All Set 得分低于 60%,Gem set 得分低于 25%。值得注意的是,20 个测试模型中有 17 个在 Gem Set 上的表现比随机猜测基线 (15.2%) 差,而估计的人类表现约为 81.1%,显示出巨大的改进空间。为了增强这种能力,本文提出了 Intentional 微调 (IFT),它在 IntentGrasp 的训练集上对模型进行了微调,在 All Set 上获得了 30+ F1 点的显着增益,在 Gem Set 上获得了 20+ 点的显着增益。值得注意的是,留一域(Lodo)实验进一步证明了 IFT 强大的跨域泛化性,验证了它是一种有前途的方法,可以大幅增强 LLM 的意图理解。总体而言,通过对意图理解能力进行基准测试和提高,这项研究揭示了一条有希望的道路,为人类利益和社会福祉提供更有意图、更有能力、更安全的人工智能助手。