论文

控制的错觉:为什么裸分类器反转在概念瓶颈文本生成中默默失败

The Illusion of Control: Why Bare Classifier Inversion Silently Fails in Concept-Bottleneck Text Generation

模型评测模型行为与机制分析

摘要

概念瓶颈可控生成通过低维概念代码路由多属性控制,在部署时,必须从目标属性配置合成该代码。我们研究了多轴组合泛化下概念瓶颈文本生成中的这个问题,比较了获得推理时间代码的三种方法:针对编码器头的分类器反转、参考文本编码和事后标签条件先验。由于概念代码不承认直接的 LM 流利项,因此正则化反转必须将代码限制为编码器的训练分布。因此,我们测试了裸反演和三个正则化变体:标签不可知和标签条件的马哈拉诺比斯惩罚,以及条件归一化流密度基线。我们测试的每个反演变体的性能都低于在相同检查点上安装到每个组合编码器平均值的简单事后先验,跨越三个主干系列,参数涵盖 $124$M 到 $8$B 参数。分类器反演的裸露形式也悄然崩溃,可追溯到直接测量的流形代码。我们根据现实世界的基准和外部评估人员验证了这一诊断,从而能够与已发布的基线进行公平比较。