论文

病态问题的拓扑:LLM检测与转向的持续同调

The Topology of Ill-Posed Questions: Persistent Homology for Detection and Steering in LLMs

模型评测模型行为与机制分析

摘要

病态问题——包括含糊、欠指定或矛盾的查询——可能没有有效答案或有多个貌似合理的答案——对大语言模型(LLM)构成挑战。既有方法大多经模型输出分析病态性——且常聚焦特定子类。我们研究多样的病态性来源能否被表示在LLM内部状态的统一拓扑中——以及该结构能否用于转向响应行为。我们把每层transformer提示token的情境隐藏态建模为点云——并用有限零维持续同调刻画其几何。每层由三个紧凑描述子总结:平均有限寿命、归一化寿命熵与最大寿命集中度。跨层拼接这些描述子得到问题的拓扑表示。我们进一步引入拓扑条件化激活转向:检索拓扑相似示例——构建查询专属激活干预——鼓励来源感知的澄清或弃权。跨三个开放权重LLM——拓扑特征在病态性分类上持续超越基于提示与池化隐藏态基线:AmbigQA平均准确率从67.4%升至78.9%、SituatedQA从79.9%升至88.5%、CLAMBER九分类从57.6%升至69.6%。拓扑条件化转向使平均总可接受响应率从61.4%升至70.6%——有据可接受响应从11.9%升至16.4%。这些结果表明持续同调既提供病态性的可解释表示——也提供定向响应转向的有效机制。

病态问题的拓扑:LLM检测与转向的持续同调:论文配图
图 3:二元不适定分类的 3-H0H_{0} 拓扑分类器的行归一化混淆矩阵。行对应于黄金标签,列对应于预测。该图报告了 Gemma-7B-it、Llama-3.1-8B 和 Mistral-7B-v0.3 上 AmbigQA 和 SistedQA 的 80/20 测试拆分结果。