论文
ESF-Bench:面向真实企业应用的高难度槽位填充场景基准测试
ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications
摘要
大语言模型(LLM)的迅速崛起推动了其在企业中的变革性应用。然而,由于复杂的系统约束与用户不可预期的行为,将这些模型部署到真实环境会带来独特的挑战。在这些应用中,槽位填充(slot filling)对于把非结构化输入转化为结构化、可操作的数据至关重要。在本工作中,我们提出ESF-Bench,一个高难度的企业槽位填充基准,由8个独特领域上的810个多轮样本与6530个槽位构成。ESF-Bench基于真实企业部署中观察到的57种最具挑战性的槽位填充场景分类体系精心构建,它揭示了当前最先进LLM的显著局限,其中GPT-OSS-120b low仅能成功提取基准样本中20.7%的槽位。为支持该领域的持续研究,我们在GitHub上公开发布了基准数据集、分类体系及配套评估代码。
