论文
看不见的编辑层:形式化已部署语言模型中未披露的推理时导向、概率配置与归因问题
The Invisible Editorial Layer: Formalizing Undisclosed Inference-Time Steering, Probability Placement, and the Attribution Problem in Deployed Language Models
摘要
大语言模型(LLM)通常在“其可观察行为主要由模型权重、训练数据、对齐程序与用户提示决定”的假设下被评估。这一观点并不完整。现代推理管线可能在token选择之前系统地修改模型产生的概率分布,在冻结的权重与观察到的文本之间形成额外的控制层。虽然受控生成(如PPLM、GeDi、DExperts、FUDGE)与文本水印系统(如SynthID-Text)证明了解码层与logit层干预的技术成熟度,但未披露的推理策略在治理、安全与经济方面的影响仍相对缺乏研究。本文考察推理时框架偏见的出现:通过在模型推理之后、token采样之前应用的干预,系统地将生成的语言导向政治、意识形态、机构或商业框架。我们形式化了“模型≠已部署系统”这一运行现实,并引入三个概念:(1)推理归因问题,刻画在有限可观察性下为何观察到的行为偏见通常无法因果地单独归因于模型权重;(2)概率配置(Probability Placement),定义一种假想的广告原语,其中商业影响通过生成概率的系统性偏移而非显式的产品植入来实现;(3)推理策略透明度(Inference Policy Transparency),一项使部署层干预可审计的治理原则。我们将这些概念与欧盟《人工智能法案》第5条、欧盟《数字服务法》以及美国联邦贸易委员会(FTC)的相关原则联系起来考察。