论文

Pitwall:基于实时比赛状态核验的自然语言赛车策略简报

Pitwall: Faithful Natural-Language Race-Strategy Briefings from a Calibrated Real-Time Monte Carlo Engine

模型推理推理验证与自校正

摘要

现场体育评论需要在时限内基于不断变化的真实比赛状态生成,且生成时不存在参考文本。Pitwall生产系统生成英语、西班牙语与葡萄牙语的一级方程式策略简报,将忠实性作为架构属性:每个发布句子拆成位置、时间差、轮胎、配速、超车及赛事控制等有类型的事实,并与触发生成的概率比赛状态核验。同一验证器筛选微调数据:3,045个模型生成目标中,仅保留每项陈述均有比赛状态支持的81.9%,其余回退到可证明忠实的模板。状态依据来自向量化蒙特卡罗引擎,每圈模拟2,000次比赛后续;以2018–2024年的126场比赛校准,并在完全留出的2025–2026赛季验证。155次回测中,预测前三名包含最终冠军的比例为90.3%,留出集Brier分数为0.0745。系统两部分均显示不同质量目标存在取舍,需分别设置检验门槛:仿真中校准最优不等于决策最优;生成中,更丰富的微调目标能提高表达生动性,却在作为依据的状态稀疏时导致幻觉。四种基础模型的复现将此问题指向指令遵循,而非模型规模,稀疏上下文审计消除了生产模型中的该问题。2026年奥地利与英国连续两场大奖赛确认从实时计时到已核验三语简报的端到端运行;银石站在结果公布前写入磁盘的带时间戳概率轨迹,于终点前十圈锁定最终冠军。