论文
行走于DARKSIDE
Walking on the DARKSIDE
摘要
大语言模型(LLM)能识别模式,但不原生追踪连贯话语所要求的排除路径。当输入建立在伪造的权威、误用的机制或偷换的类比之上时,未经引导的LLM倾向于把它当作有根据的内容来对待,并把错误步骤固化到其生成的任何结构化输出中。逻辑增强生成(LAG)方法POLANYI++——一种使用启发式、本体和问题求解方法进行默会知识提取的LLM引导方法——会生成OWL2格式的扩展知识图谱(XKG),但继承了同样的脆弱性:一个精心包装的无意义输入会与合法三元组一起被固化进图中,且几乎无法被自动推理器检测,因为XKG是与错误假设共同生成的。我们在POLANYI++之上引入DARKSIDE,一种连贯性审计方法。它将该轨迹形式化为话语时间上累积排除的显式数据结构,辅以一个保证轴(warrant axis),将每个命名指涉物分类为已保证(Warranted)、未证实(Unattested)、错误归属(Misattributed)或伪造(Fabricated),并设升级规则:当伪造率大于零或不支持率超过阈值时,将DelegationRiskAssessment推至UNSAFE。我们在BSBench上评估DARKSIDE作为Gemini 3之上的引导层,BSBench是横跨软件工程、金融、医疗、物理和法律、含100条“听起来高深的无稽之谈”的对抗语料,并以Claude Sonnet 4.6作为独立裁判。实证证据支持一个架构性主张:当LLM前向传播被包裹在以本体为中介的负轨迹装置中时,结构性的模式-路径差距可以被部分脚手架化。XKG充当缺失的记忆,保证轴则充当认知防火墙。