论文

通信瓶颈:语言模型中树结构表达式序列化的往返研究

The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models

模型评测评测方法与指标

摘要

当语言模型进行思维链推理或交换自由文本中间结果时,它们会将结构化信息序列化为自然语言。有多少树结构的组合内容能穿过这一瓶颈?我们提出一个往返协议,对树结构表达式进行实证解答:生成器将程序化生成的算术表达式转化为文字题,独立的提取器仅从文字题恢复表达式,符号等价提供精确判据。评估十六个模型的所有两两组合得到一个通信矩阵,其边际可分离生成质量与提取质量。三大发现:第一,信道有损且不对称——交换生成与提取的模型可使准确率偏移多达60.4个百分点,最佳组合是两端使用不同模型(达92.9%),而非同一模型兼任两端。第二,至少73.6%的往返失败源于生成端,且难度由树结构(算子数、深度、右分支)驱动,与模型家族无关。第三,信道可训练:约3600个共享评测算子与树形的微调样本,即能让每个开源权重模型超过未经训练的Gemini-3.1-Pro(语义匹配下的上限);在引入新算子与词汇的异域设定下,所有开源权重模型同样提升,证实增益并非语义匹配的假象,尽管与前沿模型仍有差距。这些结果共同表明,树结构表达式序列化是模型通过自然语言传递层级结构时的主要限制因素。

通信瓶颈:语言模型中树结构表达式序列化的往返研究:论文配图
图1:往返协议。生成器 G 将算术表达式 e(一棵树)转换为经过自然语言瓶颈的应用题 w。独立提取器 E 仅根据 w 恢复表达式 ê,SymPy 作为符号等价 e≡ê 的精确判定工具。无论提取器 E 如何,生成器未能编码到文本中的组合细节都会不可逆地丢失。