论文
RW-TTT:请求拥有的测试时间训练状态的批量服务
RW-TTT: Batched Serving for Request-Owned Test-Time Training State
摘要
测试时训练 (TTT) 在生成过程中通过读取和更新请求拥有的状态(例如快速权重、低秩增量或流式学习器状态)来调整 LLM。这会破坏批处理的 LLM 服务,该服务假设共享静态权重:串行执行正确但缓慢,而天真的批处理可能会破坏请求状态。我们将这个问题表述为读写 TTT 服务并呈现 RW-TTT ,它用其所有者、版本和读/写效果标记每个解码步骤,仅批处理兼容的阶段,并仅向所有者提交更新。在具有 8 个快速权重 InPlace-TTT 流的一个 GPU 上,RW-TTT 达到 274.61 聚合 tok/s,在相同内存预算下,比顺序服务高出 9.31 倍,比每个流副本高出 3.44 倍。它保留了 RULER(长上下文基准)上的行为,并通过了所有者/版本检查。