论文
找回智能体自主性:用对比认知解码缓解共识悖论
Recovering Agentic Sovereignty: Mitigating the Consensus Paradox via Contrastive Epistemic Decoding
摘要
大语言模型(LLM)对对抗性群体共识表现出参数化脆弱性。为缓解这种谄媚性(sycophancy),我们提出对比认知解码(Contrastive Epistemic Decoding, CED),一种零样本推理干预。与依赖较弱次级模型的标准对比解码(CD)不同,CED 在单一架构上执行双前向计算以隔离从众偏差。通过引入新颖的非对称、零下界概率截断与离散 top-k 截断掩码,CED 在数学上抑制毒性共识 token 而不引发语法崩坏。在使用 Gemma-2(9B)、Llama-3.1(8B)与 Mistral v0.3(7B)、在 GAIA、SWE-bench、Multi-Challenge 等复杂基准上评估 7,200 条配对轨迹时,CED 成功中和了架构与位置偏差。通过把认知偷懒最多绝对降低 33.00%,CED 带来显著性能提升,准确率恢复至多 30.75%。重获自主性引发不同的架构行为——Gemma-2 表现为被动专注任务,Llama-3.1 则主动驳斥模拟群体——表明 CED 无需微调即可把服从性与能力解耦。
