论文
上下文学习器何时应扩展假设空间?
When Should an In-Context Learner Expand Its Hypothesis Space?
摘要
学习系统在熟悉的模型系列中快速适应。更困难的一步来得更早:根据可能是噪音、例外、家庭内部或外部结构的变化的观察来决定建立一个更富裕的家庭是否值得付出代价。我们将其视为代价高昂的顺序决策:预测失败必须转化为结构性证据,证据转化为扩展价值,价值转化为行动。结构修订环境从每个来源产生匹配的失败,独立于证据改变扩张的价格和剩余范围,并允许精确的贝叶斯计算和一次性决策的精确规范解决方案。它的解决方案表明,修正是一个价值边界,而不是一个证据阈值:一个历史在不同的价格、视野和宣布的查询下有不同的最佳行动,局部修复和扩展之间的边界是由规则预测的输入设定的,而修复无法覆盖,并且对富裕家庭的信念早在决策之前就已经跨越了。在环境中训练的变形金刚仅从效用中再现了这一边界。三个训练后谱系的语言模型在其预测中携带了对失败敏感的信号,该信号并未反映在其修订决策中,并且考虑到扩展的收益,他们在阅读该信号时无需将其与价格和视野进行权衡。允许推理的三个模型权衡了参考比例中的规定收益,但仍然没有将历史转化为对扩张将带来什么的估计。对经过元训练的学习者进行受控的后训练会改变预测的先验和清晰度,但不会改变标准。