论文
TEFM:结构化数据的词元高效忠实建模
TEFM: Token-Efficient Faithful Modeling for Structured Data
摘要
在本文中,我们解决了将 LLM 应用于关键领域的两个基本障碍:词元效率和 忠实性。为了共同解决这两个约束,我们提出了 TEFM(词元高效忠实建模),这是一个专为关键领域的结构化数据分析而设计的框架。 TEFM 通过将冗长的结构化观察结果压缩为紧凑的行为代码词元来实现词元效率,从而以最小的信息损失显着减少词元消耗。此外,TEFM 通过双保真度目标实现忠实合理化,联合优化代码级重建和预测级保真度,识别基于输入数据的最小足够特征子集。跨各种领域数据集和模型主干(Qwen3、Gemma-2、Phi-4)的综合实验表明,TEFM 通过大幅减少标记(临床中大约 1% 的标记保留,安全领域中大约 2% 的标记保留)实现了有竞争力的分类准确性,同时产生了忠实的理由。