论文

语言模型诚实度评估中的仪器效应:可审计的单系统演示

Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration

模型评测评测方法与指标

摘要

语言模型诚实度评估把模型的裁决读作关于模型的证据。我们测试仪器本身。我们构建一个文字冒险世界:游戏引擎——而非任何模型——知道任务能否完成。语言模型在预算下游玩,必须最终宣告其任务“完成”“不可达”或“尚不可判定”;引擎为每个裁决打分。决策规则在读取结果前记录,运行工件绑定其执行的修订;预注册强度因系列而异并予以披露。玩家固定时,仪器选择实质改变测得行为。在四个字节相同的锚上:把两裁决文法扩为三裁决,使强论断从38/40移到7/40,而新的不完整裁决占据28/40的结果;跨系列2,93/158局有效游戏以不完整告终。一句披露成功标准的话把匹配实例的假裁决从18/59降到0/58——经由更少的决策点与更干净的决策。同一固定配置的重复运行在4个实例中的3个上产生不稳定的裁决分布:单次运行把样本报告为倾向。一个正式预注册的叙事语域梯度被证伪;两个事后、假设生成的模式留存:语域存在大致使强论断翻倍,而预算呈现方式比语域内容更多地移动裁决(0.383米尺对0.150灯笼)。叙述者把充足预算压缩向稀缺地标,但注册的中介检验返回零。我们为评估仪器提出四项完整性检查协议。