论文
大语言模型可以“超线程”吗?
Can Large Language Models "Hyper-Thread"?
摘要
大语言模型 按顺序生成词元,但是它们可以在形成每个词元时同时执行多个任务吗?更广泛的注意力分配可能为这种任务并发提供一种机制。现有的缩放推理方法主要依赖于更长的生成、更多的样本或额外的验证阶段,而注意力分散通常被视为干扰或错误的信号。因此,串行生成中的任务并发性仍未得到充分研究。我们提出模型超线程假设,并使用在同一问题内共享状态的多个协调任务来评估其预测。我们设计了三个条件(基线、串行功能调度和并发功能加载),并使用准确性、输出词元分布和注意力指标来评估它们的收益和成本。在 AIME 2025 开发集上,并发功能加载实现了最高的准确度。相对于串行功能调度,它的典型输出长度相似,并且在大多数问题上更短,同时表现出更大的注意力分散和更高的任务相关覆盖率,尽管输出长度尾部更重。步内并发及其因果机制仍然需要直接测试。我们的结果表明,更分散的注意力可以与更高的准确性共存,为超线程假设提供了初步的行为和相关证据。这些发现促使推理扩展的视角从“生成更多词元”转向“让每个生成步骤承载更多任务”,为提高推理性能指明了新途径。