论文
启示控制
Revelation Control
摘要
揭示控制是选择有价干预措施的问题,这些干预措施仅在所揭示的区别可以改变相应决策的情况下才揭示隐藏状态,同时单独考虑干预本身所创造的任何有用进展。我们为学习系统开发了这一理论,其中声明的当前信息下的等效状态可以对未来的训练做出不同的反应并支持不同的行动。该框架定义了决策充分的揭示和揭示深度,将纯粹的信息价值与生产性重用分开,将静态贝叶斯细化嵌入到状态相关的连续值中,并给出了精确的成本调整因子分解标准:仅当共享标量摘要的状态位于定价停止/继续边界的相对侧时,附加的浅坐标才是决策非冗余的。我们还为特定于模型的实例化提供了一个与目标无关的协议,并证明仅有限的停止翻转风险无法在不受限制的严重性下证明正的预期效用。在 Qwen2.5-7B 和 Mistral-7B-v0.3 中,更深入的未来学习探索具有积极的决策价值,并且高效的重用产生严格的同等计算效用优势。 Qwen 还为决策非冗余的浅层可揭示性机制提供了证据;在 Mistral 中,仅适合独立开发面板的标量延续架构在不相交的目标面板上保留正的系列调整下限,与测试架构系列和分辨率内的标量决策充分性一致。证据支持结构性而非数字性转移:决策理论、成本核算、延续逻辑和评估协议传输,而经验代理、系数、阈值,甚至所需的浅层状态维度可能是特定于系统的。