论文

语义内容决定算法性能

Semantic Content Determines Algorithmic Performance

模型评测基准与评测资源

摘要

计数不应取决于所计数的是什么;更一般地,任何算法的行为都应对其参数的语义内容保持不变。我们提出WhatCounts以在隔离状态下检验这一性质。与先前将语义敏感性与推理复杂度或提示变化混为一谈的工作不同,WhatCounts是原子的:在不同语义类型的无歧义、有分隔且无重复、无干扰项、无需推理步骤的列表中数数。前沿LLM仅因所数对象不同——城市与化学品、名字与符号——就表现出超过40%的准确率波动。受控消融排除了混淆因素。这一差距是语义性的,并且会随少量无关微调而不可预测地移动。LLM并不实现算法;它们近似算法,而这种近似依赖于参数。正如我们用一个agentic示例所展示的,其影响超越计数:任何LLM函数都可能对其输入的含义带有隐藏依赖。

语义内容决定算法性能
图1:WhatCounts 概览。上面板对比理论理想情形与观察到的 LLM 行为。理论上,算法(例如计数)应与其参数的含义无关,对城市列表或 emoji 列表的表现应完全一致。结果表明准确率在不同语义类别间变化剧烈。我们进一步运行受控消融(例如 token 洗牌、token 数量对照与显式分隔符指定),均无法消除对语义类别的依赖,有效证明了这种固有的语义脆弱性。