通过事实启发式情绪状态执行来测量和提高 大语言模型 中的行为一致性
Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement
摘要
大语言模型 (LLM) 可以在运行中对同一决策问题给出不同的答案,并在其之前的答案作为上下文返回时反转决策。我们询问是否可以在不改变模型权重的情况下测量并部分减少这种不稳定性。我们测试认知内核模型(CKM),这是一个提示级状态执行层。在做出决定之前,模型必须将其输入分为三个认知角色:事实(给定或可验证)、启发式(推断或假设)和情感(评估或优先信号)。 CKM 不增加任何功能;它迫使模型在行动之前跟踪它使用的信息类型。形式上,它维护由转换函数更新的结构化状态 S_t = {F_t, H_t, E_t}。我们通过四个核心实验、4 臂消融、5 臂假限制消融和温度探针,在来自 4 个供应商的 26 个 LLM 和 37,403 个观察结果中评估韩语决策场景(歧义、道德冲突、资源分配、错误处理)的 CKM。研究结果:(1) CKM 降低了重复输出变异性(随机效应 Hedges' g=1.09,95% CI [0.83, 1.35],31 个模型对); (2) 在新模型中,状态持久性将决策翻转率降低了 82% (g=1.52); (3) 效果不仅仅是JSON格式化(仅值重新计算,g=2.24); (4)固定锚状态下的内在随机性可以忽略不计; (5)在采样随机性下优势增大(温度0.7时g=2.87); (6) 假消融将大约 45% 的增益归因于结构支架,55% 归因于事实/启发式/情感内容,而 CKM 是唯一既提高一致性又减少翻转的手臂。 CKM 并不能提高推理的正确性。更狭义的结果是:行为一致性是可测量的,不同模型之间存在差异,并且可以通过迫使模型在做出决定之前分离事实、假设和评估信号来部分改进。