论文
不同信息的上下文:用于长冗余上下文流的可审计狄利克雷过程工作记忆
Context by Distinct Information: An Auditable Dirichlet-Process Working Memory for Long, Redundant Context Streams
摘要
上下文工程决定模型携带哪些信息,当前的设计以词元来计量它:将过去压缩为有界的循环状态,为每个词元保留一个键值条目,或者通过窗口或驱逐规则施加固定预算。即使流是冗余的并且任务取决于它所携带的不同信息,这三者都使词元成为内存单元。基于仅当传入键是新颖的时才打开缓存槽的配套机制论文,因此内存随着不同项目的数量而不是词元的数量而缩放,我们开发了分配新颖性缓存作为工作内存组件,并通过任务如何依赖于过去来组织上下文:回忆携带的信息属于内容寻址的新颖性缓存,摘要携带的信息处于循环状态,位置携带的信息处于新近度窗口中。该主张是经验性的且有限制的。在匹配的字符级控制上,新颖性门控注意力在关注大约一半的词元的同时达到了全注意力性能,并且将缓存与状态空间摘要耦合以降低的成本匹配全注意力耦合;随着上下文的延长,优势会越来越大,而滑动窗口在较短的、局部性主导的跨度上更可取。在对合成医疗保险索赔的下一个代码预测中,耦合组件引起了充分的关注,并且在千个事件范围内的每个固定预算驱逐策略,而对同一流的成本预测是摘要携带的并且缓存是中性的。保留的记忆是一个可检查的模板、代码、药物或位置表,而不是不透明的状态。实验规模小,仅使用公共数据;他们建立了一个原语,即上下文可以在内容可寻址和可审计的工作记忆中使用不同的信息而不是词元进行扩展。