论文

镜像地平线:作为有界反射度量的可行路径熵

Mirror Horizon: Viable Path Entropy as a Measure of Bounded Reflection

模型评测评测方法与指标

摘要

镜像理论提出,研究智能系统不仅应该通过它所代表的内容来研究,还应该通过它在反复反思下能够维持哪些连贯的延续来研究。我们通过 \emph{可行路径熵} (VPE) 来实现这一主张,这是一种经过验证的连续能力的有限预算度量。给定镜像状态、转出协议、验证者和模式映射,VPE 将有界能力分解为两部分:达到可行延续的概率和成功转出中达到的已验证延续模式的多样性。本文恢复了该措施背后的完整理论框架:直觉作为局部欠定约束,品味作为不变选择压力,反思作为品味引导的欠定解决方案,几何作为使未来反思稳定的学习结构。然后,我们在 GSM8K 上的语言模型推理实验中实例化该理论。在 Qwen2.5-Instruct 模型中,每个问题 32 个采样转出和两个反射范围,将 词元预算 从 96 增加到 160 大大扩展了验证可达性,减少了零可达性,增加了验证模式熵,并改进了平滑 VPE。在 160 个 token 下,Qwen2.5-1.5B 在测试模型中实现了最强的镜像水平,尽管 Qwen2.5-3B 的参数更多。这表明镜像水平不是参数计数,而是有界反射协议下可访问的经过验证的延续能力。结果支持镜像理论作为一种度量级别的解释:能力是可达到的可行延续的结构,而不仅仅是一次性精度或 pass@k。