论文
LLM介导的普适系统中的权威倒置:当模型更相信用户而非传感器
Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors
摘要
大语言模型(LLM)在普适系统中越来越多地融合异构输入。然而,当传感器测量与用户声称冲突时,LLM如何隐式分配权威仍未被研究,这对物理传感必须保持优先级的部署提出了关键的可靠性担忧。与显式的传统融合不同,LLM将权威分配埋藏在习得的表示之中。我们发现这种分配严重依赖格式:数值传感器数据无法整合进与答案相关的模型方向,使自然语言声称主导最终决策,我们将这一现象称为权威倒置(Authority Inversion)。为诊断并缓解这一问题,我们开发了上下文整合的几何框架,引入两个可计算的审计指标——上下文整合比率(CIR)与权威对齐指数(AAI),并提出几何权威校准(GAC),一种在推理时进行层级干预以抑制错置的用户权威的方法。对四个模型(4B至35B参数、三种架构)在共576个冲突实例的四个数据集上的评估揭示了极端倒置:在数值任务上,模型表现出近乎为零的传感器信任(AAI = -0.805,Cohen's d = -2.14),且不受模型容量影响。理论引导的因果注入翻转了80.2%的错误决策(随机对照为<0.4%),验证了我们的几何框架。在实践上,GAC将HAR准确率从0-1.6%提升至21.9-27.5%,优于提示词基线。归根结底,LLM介导系统中的权威分配必须被显式审计并按应用进行配置,而不能保持隐式。