论文
超越困惑:LLM 测试时训练中部署内存声明的行为评估框架
Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training
摘要
大语言模型 测试时训练 (TTT) 通常通过本地代理指标进行评估:模型根据最近的词元、检索到的上下文、目标域数据或可验证的任务尝试进行更新,然后根据困惑度、未来词元损失、长上下文性能或奖励进行判断。这些指标与流适应、领域适应、上下文压缩和奖励支持的测试时间改进的主张非常匹配。然而,对于 TTT 结果越来越多地用于激发的能力而言,它们是较弱的证据:部署的辅助记忆、个性化或稀疏的部署后学习,而这需要行为证据,例如后来的回忆、释义稳健性、保留、局部性、冲突处理以及在原始支持上下文被删除后在下游操作中的使用。我们引入了一个行为评估框架,将 TTT 记忆主张与支持它们的证据进行校准。它有两个组成部分:一个声明校准的证据阶梯,它将流/域适应、桥梁内化和部署时行为学习分开;以及具有匹配的显式记忆基线和互斥故障类别的评估协议。我们通过审核最近的 TTT 和内存相邻工作并将其实例化为受控诊断来验证该框架,其中在稀疏的随机事实设置中,一步 LoRA 更新了三个 Qwen3 模型规模的较低支持和答案损失,同时生成的自由形式召回保持为零,暴露了代理改进和部署行为之间的可测量差距。该框架为作者和评估者提供了一个具体标准,用于将 TTT 记忆主张与实际报告的证据相结合。