论文
语义内容决定算法性能
Semantic Content Determines Algorithmic Performance
摘要
计数不应取决于所计数的是什么;更一般地,任何算法的行为都应对其参数的语义内容保持不变。我们提出WhatCounts以在隔离状态下检验这一性质。与先前将语义敏感性与推理复杂度或提示变化混为一谈的工作不同,WhatCounts是原子的:在不同语义类型的无歧义、有分隔且无重复、无干扰项、无需推理步骤的列表中数数。前沿LLM仅因所数对象不同——城市与化学品、名字与符号——就表现出超过40%的准确率波动。受控消融排除了混淆因素。这一差距是语义性的,并且会随少量无关微调而不可预测地移动。LLM并不实现算法;它们近似算法,而这种近似依赖于参数。正如我们用一个agentic示例所展示的,其影响超越计数:任何LLM函数都可能对其输入的含义带有隐藏依赖。
