论文
PACT:针对单词元类型决策的成对锚定校准调整
PACT: Pairwise-Anchored Calibrated Tuning for Single-Token Typed Decisions
摘要
单词元类型化决策模型通过读取同一位置上少数单字母答案编码的logits来回答预定义问题,速度较快,并为每个允许答案给出概率。然而,普通交叉熵训练忽略了训练数据的大部分结构。本文研究一种使用对比样本对训练的模型:两个上下文只在一个决定答案的事实上不同,并附有机器核验的证明,确认删去关键句后该事实变为未知。PACT把这一结构转化为四项无需新增标注的训练目标:对共享logit偏移不敏感的样本对双重差分间隔、抑制答案编码位置偏差的置换一致性、基于已验证删句上下文的证据必要性,以及评分字段的有序运输成本,并加入三个参数的上下文温度。在324项固定留出集、三个随机种子的测试中,PACT与已发表方案的准确率相近(84.6%对85.2%,每个种子的McNemar检验p≥0.50),但在各次运行中位置偏差最低(更换标签后的答案翻转率9.8%对13.8%),评分字段的序数误差也最低(MAE 0.232对0.311)。相比采用相同优化器与训练计划、仅使用交叉熵的对照,PACT在三个种子中有两个的准确率显著更高,种子间波动减半,负对数似然下降26%。种子配对消融与预先规定的证伪测试表明,没有任何单项直接提高原始准确率,价值主要在稳健性和稳定性,而非最高准确率。代码、数据划分、适配器与运行记录见https://github.com/BennyLinntu/PACT-Pairwise-Anchored-Calibrated-Tuning-for-Single-Token-Typed-Decisions。