论文

Augur:预演产品与政策变化反应的合成决策实验室

Augur: A Synthetic Decision Lab for Rehearsing Reactions to Product and Policy Changes

模型评测评测方法与指标

摘要

在产品或政策变化上线之前,重要的问题是人们会作何反应。Augur在线下预演这种反应:它从变更文档构建类型化知识图谱,填充有据的人物市场,模拟交互,并返回可审计的决策备忘录,推荐五种行动之一。我们汇编了Gold-50——五十个真实产品与政策事件,其真实世界结果已知并经公开记录裁定——并对照它为五选一的发布判定打分。我们的核心发现是方法学的且是否定性的:前沿云模型与我们微调并线下服务的开放权重模型之间测得的大部分差距,可归因于评测的不充分界定,而非能力差异。我们通过三种方式证明这一点。第一,仅提示封装即可主导得分:在权重、案例和评分器固定的情况下,一个系统——Qwen3-32B上的LoRA-SFT适配器——从0%摆动到73%。第二,在匹配的2x2消融中,在提示中定义决策分类法——不改变模型——使每个前沿模型提升+24到+34个百分点;在不充分界定的提示下,Qwen3-32B LoRA-SFT线下服务击败全部三个前沿模型(配对McNemar,Holm校正),而一旦提示公平,则检测不到与它们中任何一个的显著差异。第三,与蒸馏教师的一致性上升而准确率并未随之上升,完整流水线放大了系统性的过度悲观偏差而非改善判定。另外,我们独立验证反应层本身:跨四个模型家族的盲评裁判发现合成反应恢复了公众实际提出的67-90%的关切,一项预注册消融定位了其价值——决策最难处价值最大,接近天花板处冗余。重新生成本文所有数字和图表的流水线可向作者获取。