论文

通过学习查询改进信息提取

Improving Information Extraction with Learned Queries

上下文与知识上下文工程

摘要

当信息提取失败时,一种自然的本能是改进执行此操作的模型:例如,通过扩展模型或完善其推理。在本文中,我们表明管道的另一部分至少同样重要:用于获取此信息的查询。在四个临床基准和五个 LLM 中,仅改进问题设计就可以将性能提高 18.6 个 F1 分数,即比使用更大的提取模型更高。为了使此类问题设计易于学习,我们引入了问题列表(LoQ)和 FeedQ,前者可生成特定于文档的问题集,后者是一种反馈驱动的优化方法,可针对提取结果迭代地细化问题。由此产生的优化问题可用于训练轻量级生成器:使用 微调,4B 参数模型匹配或优于专家得出的基线,并大大超过了更大的未调整模型的性能。我们发布了包含 12,820 个优化问题的数据集,以支持信息提取研究向将问题设计视为一流问题的更广泛转变。