论文
免费午餐不再存在:随着语料库的增长,语料库任务的复杂性变得越来越重要
No More Free Lunch: Corpus Task Complexity Matters as Corpora Grow
摘要
鉴于语料库很大,人们可能会问的问题可能会有所不同 - 从“第一次人类心脏移植是什么时候?”到“该文献中所有相互矛盾的主张是什么?” ——但是是什么让某些问题比其他问题更具挑战性呢?在这项工作中,我们定义了语料库任务复杂性(CTC)的概念,它通过任务难度如何随语料库大小而增长来描述任务;例如,检索查询仅需要对语料库进行一次线性传递,而查找矛盾则需要检查二次增长的声明对集。观察到之前的工作很大程度上只研究了难度随语料库大小线性增长的任务,我们称之为低 CTC 任务,我们引入了 10 个属于高 CTC 类的新任务,其难度随语料库大小呈二次方或更多增长。我们发现,对于 LCLM 而言,高 CTC 任务不仅在较长的上下文中平均变得更具挑战性,而且还推翻了许多仅从低 CTC 评估中得出的建模结论。例如,高效的块稀疏和混合注意力方法在低 CTC 任务上始终与完全注意力性能相匹配,但在高 CTC 任务上性能下降更多。因此,大型语料库高 CTC 推理仍然是一个开放的挑战,因为充分关注的成本太高而无法扩展,这激励了未来对这些任务的研究。我们发布了代码、数据和 22 任务套件 (CTC-Bench),以促进该领域的未来研究。