论文
The Silicon Mirror:LLM Agent中用于反谄媚的动态行为门控
The Silicon Mirror: Dynamic Behavioral Gating for Anti-Sycophancy in LLM Agents
摘要
大语言模型 (LLM) 越来越优先考虑用户验证而不是认知准确性,这种现象称为阿谀奉承。我们推出了 The Silicon Mirror,这是一个编排框架,可以动态检测用户说服策略并调整人工智能行为以保持事实完整性。我们的架构引入了三个组件:(1) 行为访问控制 (BAC) 系统,根据实时阿谀奉承风险评分限制上下文层访问;(2) 特征分类器,识别多轮对话中的说服策略;(3) 生成器-评论家循环,审计员在其中否决阿谀奉承的草稿并通过“必要摩擦”触发重写。在使用 Claude Sonnet 4 和独立大语言模型法官对 50 个 TruthfulQA 对抗场景进行的实时评估中,我们观察到普通的 Claude 谄媚为 12.0% (6/50),静态护栏为 4.0% (2/50),而 Silicon Mirror 为 2.0% (1/50),相对减少了 83.3%(p = 0.112,费舍尔精确值)测试)。对 Gemini 2.5 Flash 的跨模型评估显示,基线阿谀奉承率较高 (46.0%),而在 Silicon Mirror 下,阿谀奉承率显着降低了 69.6% (p < 0.001)。我们将校正前验证模式描述为 RLHF 训练模型的独特故障模式。
