论文
通过概念链进行隐式推理指导
Implicit Reasoning Steering via Concept Chaining
摘要
大语言模型 通常看起来推理可靠,但在许多问题上,重复采样会产生正确和错误的答案,揭示了最终决策形成方式的潜在脆弱性。我们研究是否可以通过隐式推理引导来利用这种脆弱性:使用自然语言文本使模型偏向指定答案,而无需明确的指令、触发器或直接答案提示。我们的方法“概念链”生成一个简短的连接段落,通过一个或两个中间概念将问题实体链接到目标选项。然后,我们继续在这些连接段落上预训练受害者模型,并评估其答案偏好是否会随着原始多项选择题的变化而变化。我们的结果表明,间接、自然的文本可以系统地引导模型预测,同时比直接释义的可推断性要低得多,这表明推理脆弱性不仅仅是一种评估伪影:它创建了一个实用的渠道,通过该渠道,看似普通的文本可以放大潜在偏见,从而秘密地重定向模型决策。