论文
测试时发现的认知不确定性
Epistemic Uncertainty for Test-Time Discovery
摘要
使用 大语言模型 的自动化科学发现依赖于识别真正新颖的解决方案。标准强化学习会惩罚高方差突变,这导致策略优先考虑熟悉的模式。因此,即使平均奖励增加,最大奖励也会趋于稳定。克服这一限制需要一个信号来区分未探索的区域和本质上困难的问题。这需要衡量独立调整的权重假设之间的分歧,而不是依赖单个网络的置信度。 UG-TTT 通过在冻结的基础模型上维护一个低秩适配器的小型集合来解决这一挑战。每个标记的分歧被量化为整体预测和权重假设之间的相互信息,隔离了认知不确定性,并识别了覆盖不足导致适配器发散而不是内在问题困难的位置。该措施作为探索奖励纳入政策梯度中,将政策引导至持续的适配器分歧表明训练覆盖率较低的位置,这也是可能进行真正发现的同一前沿。核范数正则化器确保适配器彼此保持不同,从而在整个训练过程中保留探索信号。在四个科学发现基准中,UG-TTT 增加了三项任务的最大奖励,保持了更高的解决方案多样性,并且消融研究证实正则化器对于维持这种行为至关重要。