论文

语义三元组恢复:大语言模型 中分层表理解的新协议

Semantic Triplet Restoration: A Novel Protocol for Hierarchical Table Understanding in Large Language Models

上下文与知识上下文工程

摘要

表格问答需要模型恢复由二维布局、合并单元格和分层标题隐式编码的语义关系。当前的管道通常使用 HTML 或 Markdown 作为中间表表示,但这些面向布局的序列化引入了标记开销,并且需要 大语言模型 从行和列跨度推断标题单元格对齐。我们提出语义三元组恢复(STR),一种将每个单元重写为原子事实<项目路径,特征路径,值>的协议,其中项目路径指定行实体,特征路径指定层次属性,值包含单元内容。我们还推出了 TripletQL,这是一种轻量级查询感知路由器,它使用 STR 为每个问题选择适当的渲染或过滤的三元组子集。在四个中文和英文表格 QA 基准测试中,STR 匹配或改进了基于 HTML 的基线,同时减少了输入标记。对于较小的语言模型和较长的表上下文,相对收益会增加,这表明显式语义表示在推理预算受限的情况下特别有用。代码和数据可在 https://github.com/Phoenix-ni/STR.git 获取。