论文

代理对话人工智能中风格可控和事实保留生成的知识图门控去事实化

Knowledge-Graph-Gated Defactualization for Style-Controllable and Fact-Preserving Generation in Agentic Conversational AI

上下文与知识知识图谱

摘要

部署在客户支持等事实敏感应用程序中的代理 大语言模型 (LLM) 必须同时保持事实正确性并在可控风格寄存器中生成响应。激活控制通过扰乱隐藏表示来实现 微调-free 风格控制,但它缺乏区分可验证事实和风格内容的明确机制,从而导致语义泄漏。我们通过 \emph{Defactualize-Steer-ReHydrate} (DSR) 来应对这一挑战,这是一个知识工程框架,它将类型化、显着性加权的知识图 (KG) 与激活控制集成在一起。 DSR 使用分层正则表达式或 NER 或词汇分类器管道提取显着实体,在转向之前用类型化占位符替换它们,并在生成后通过显着性引导的补水确定性地恢复验证值。 DSR 通过专门的 KG 消融研究,在 600 个 A2A 生成的客户支持案例(1,200 代)上跨 6 个 LLaMA 系列模型(1B--13B 参数)进行评估。相对于仅转向基线(Cohen 的 $d=0.225$,$p_{\text{Bonf}}=1.0\times10^{-4}$),DSR 显着提高了经过验证的实体恢复,尽管绝对恢复率仍然不大,同时在不同模型系列中保持有效的风格控制。分层可分离性和转向强度诊断进一步显示了先前未探索的表示级转向和事实基础之间的相互作用。这些结果表明,显式知识工程可以系统地增强可信、可控和可重复的生成人工智能,而不需要模型 微调。公开发布代码、缓存的转向向量和评估脚本以支持可重复性。\footnote{https://github.com/Tanmay-IITDSAI/KG-Gated-Defactualization}