论文

认知惩罚:面向去中心化共识在边缘原生SLM中消融系统1与系统2推理

The Cognitive Penalty: Ablating System 1 and System 2 Reasoning in Edge-Native SLMs for Decentralized Consensus

模型评测模型能力评测

摘要

去中心化自治组织(DAO)倾向于探索将小语言模型(SLM)用作边缘原生的宪法防火墙,以审查提案并缓解语义社会工程攻击。尽管扩展推理时算力(系统2)可增强形式逻辑能力,但其在高度对抗的加密经济治理环境中的效力仍未被充分探索。为此,我们提出Sentinel-Bench,一个执行840次推理的实证框架,在Qwen-3.5-9B上进行严格的模型内消融。通过在冻结权重上开关潜在推理,我们在对抗性Optimism DAO数据集上隔离出推理时算力的影响。我们的发现揭示了一种严重的算力-准确率倒置。自回归基线(系统1)实现了100%的对抗鲁棒性、100%的法律一致性,并在13秒内达成状态终结。相反,系统2推理带来灾难性的不稳定,其根本驱动因素是26.7%的推理不收敛(认知崩溃)率。这种崩溃将试次间共识稳定性降至72.6%,并带来17倍延迟开销,造成对治理可提取价值(GEV)和硬件中心化的关键脆弱性。虽然罕见(占对抗试验的1.5%),我们实证捕捉到“推理诱发的谄媚”现象:模型生成明显更长的内心独白(平均25,750字符)来为其落入对抗陷阱寻找理由。我们得出结论:对在拜占庭容错(BFT)约束下运行的边缘原生SLM而言,系统1的参数化直觉在结构上和经济上都优于系统2的迭代审议。代码与数据集:https://github.com/smarizvi110/sentinel-bench