论文
CUIO:好奇心驱动的测试时学习,实现开放式发现
CURIO: Curiosity-Driven Test-Time Learning for Open-Ended Discovery
摘要
开放式发现需要从反复尝试中学习,同时继续探索价值尚不明显的方向。使用冻结的大语言模型 (LLM) 进行搜索可以在上下文中重用以前的解决方案,但无法根据测试问题的成功和失败来更新模型。强化学习(RL)可以实现这种适应;然而,强烈偏爱高回报轨迹可能会过早抑制低回报但可能有希望的方向。我们推出了 CURIO,这是一个好奇心驱动的测试时学习框架,它通过内在好奇心世界模型 (ICWM) 补充任务反馈。 ICWM 学习策略隐藏状态表示中的转换,并在策略的 top-k 选择之外的采样token处提供预测误差奖励。 Epoch 归一化和退火权重调节它们对策略更新的贡献。在 6 个数学发现任务和使用 Qwen3 骨干模型从 8B 到 235B 的单细胞去噪中,三运行均值在五个数学目标上比匹配的纯任务 RL 控制有所改进,与 Circle Packing 上报告的最佳性能相匹配,并在每个测试尺度上提高了留出语料库上的去噪得分和均方误差 (MSE)。 Hadamard 的相对增益达到 18.3%,去噪 Score 的相对增益达到 10.8%。代码多样性测量显示生成的程序之间存在更大的结构差异,支持好奇心作为开放式发现中学习的补充探索信号。
