论文
元认知引导:学习科学判断的过程结构
Metacognitive Steering: Learning the Structure of Scientific Judgment
摘要
长周期科学发现需要智能体随证据在探索、严谨执行和批判复核间切换。当前语言模型主要学习科学成果、用结果级信号优化,缺少这些过程判断监督。我们研究能否从科学家交互轨迹恢复判断,用于控制冻结前沿模型内部计算。利用真实科研收集的对比干预,我们在万亿参数MoE Kimi 2.6内识别协同低维控制结构。残差分析、注意力权重子空间对齐和跨层奇异值分解共同指向跨关键层的中等深度控制面。我们提出推理时控制器Metacognitive Steering,读取模型认知状态,动态组合逐层干预以探索、程序收敛或批判重审,不修改参数。行为分析显示更持久探索、明确剪枝和响应证据的综合。我们在自主研究系统Columbus-1中实现方法,发现BlueZ中八个经独立复现、攻击者可触达漏洞,并指导十英尺火箭设计、模拟及制造,其目标是使用不可节流固体发动机推进着陆。这些结果表明,过程级科学判断能监督对推理策略的可解释动态控制。