论文
从检查者到预测者:延迟真值下模型生成策略路线的代码自有评估
From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth
摘要
许多对模型输出的评估要么依赖评估时即可检查的契约,要么依赖运营回路内即到的反馈。我们研究互补设定:真值延迟、删失或私有,确定性代码无法在打分时检查正确性,必须代之以发出代码自有的临时预测。RouteCast为模型生成的类型化策略路线实例化该regime:模型提出候选路线与结构化因子;时点证据、参照类与确定性变换产出临时预测排序;后续结果评估该预测。在一项回顾性风投试点(21个二元结果案例:6正15负)中:整包RouteCast分显示初步的回顾性判别力(AUC 0.756,95% CI [0.471, 0.980]);盲法LLM裁判AUC 0.678 [0.419, 0.897]、身份暴露LLM裁判AUC 0.761 [0.515, 0.944]——与识别性或结果相关泄漏风险一致。同二元子集上的预注册分解消融发现:把相同输入转为类型化分段路线,与整包分数不可区分(ΔAUC=-0.144,95% CI [-0.471, 0.176])、与确定性启发式亦不可区分(ΔAUC=-0.089,95% CI [-0.412, 0.278])。该试点确立了可审计的可行性结果并暴露失败模式;它不确立前瞻校准、因果决策改进、路线分解优势或跨域效度。