论文
开源权重模型的行为重编程:认知可塑性与对齐边界
Behavioral Reprogramming of Open-Weights Models: Cognitive Plasticity and Alignment Bounds
摘要
大语言模型(LLM)目前主要被对齐为被动、迎合式的助手。我们通过实证评估开源权重架构在严格行为重编程下的认知可塑性,来挑战这一默认范式。我们的目标是诱导出一种主动的、苏格拉底式的对话框架,其特征是在严格受限的高性能计算(HPC)条件下高频生成问题。通过由405个HPC作业组成的大规模并行超参数扫描,我们为参数高效微调(PEFT)定义了精确的数学边界。我们确定了LoRA秩 r=16 处的架构阈值,并通过大量轮数消融证明,泛化能力严格在依据数据集密度而定的优化训练窗口 e ∈ [2, 3] 内达到最优收敛(最低验证损失为0.919)。此外,将模型容量扩展到14B参数获得了更低的局部评估困惑度(1.414)。随后的直接偏好优化(DPO)成功地将底层断言性行为与局部句法解耦;严格的跨语言压力测试则揭示了零样本人格迁移的能力与结构性边界:在亲缘关系较近的语言族中表现出稳健的对齐,而在形态差异较大的目标语言中存在可识别的退化路径。这些发现为计算高效、跨语言的行为修改建立了严格的实证框架。
