论文
超越终点分数:持续知识更新的时间和能力条件评估
Beyond Endpoint Scores: Time- and Capacity-Conditioned Evaluation of Continual Knowledge Updating
摘要
持续的知识更新方法通常从一个最终检查点和一个传统的适配器等级来看是优越的。我们证明这可能不足以确定更好的工作点。保持固定的周期性层次结构,我们将其与 24 个月维基数据流的累积重播进行比较,同时改变评估月份、重播 LoRA 排名和查询公式。整个区域的明显获胜者发生变化:在 Qwen2.5-1.5B 上,等级制度相对于排名 8 重放的 5.0 分优势变成了相对于排名 72 重放的 11.6 分的劣势,并且在高排名时,整合对齐的端点可能表明平局,而时间平均重放领先 9-13 分。同样的排名条件反转也出现在 Llama-3.2-1B 和保留的释义上。这些结果表明,持续更新中的方法排名可以共同取决于何时测量性能以及基线接收到多少重放端适应能力。因此,我们建议报告轨迹和容量扫描,并仅当整个评估区域的排序稳定时才宣布强大的获胜者;否则,比较应报告获胜区域和保留-稳定性-成本边界。在此协议下,周期性层次结构是更新成本较低的操作点,而不是质量赢家。