论文

EnigmaForge:问题藏在故事里

EnigmaForge: The Question Is Hidden in the Story

模型评测基准与评测资源

摘要

大多数基准把问题直接交给模型。EnigmaForge交给模型的则是一摞旧文档,而且根本不给出问题。埋在信件、收据和日志边角里的是一个小的逻辑谜题,其解是唯一的——这在生成时由SAT求解器证明,并附带消融证书,表明每条线索都不可或缺。由于实例是生成而非收集的,该语料库可以永久更新。核心指标是直觉:只给模型故事时的任务成功率,世界重建作为次要维度。25个前沿模型在三种匹配条件下运行了600多个实例(17,400条打分记录)。直觉重新洗牌了排行榜:事实恢复的差距为1.6倍,而直觉的差距达22倍;事实恢复第二好的模型在直觉上仅排第十四;一个模型被告知问题与否表现无差别,另一个模型在不被告知问题时反而显著更好。若干模型在到达谜题之前就被自身的内容过滤器拦下——任何把拒答计为失败的基准,实际上都在悄悄度量过滤器行为。