论文
道德能力先于道德内容:为何LLM智能体缺乏实现一致对齐的先决条件
Moral Competence Before Moral Content: Why LLM Agents Lack the Prerequisites for Coherent Alignment
摘要
人工智能一致性要求人工智能系统遵守人类规范、价值观或意图。在价值多元主义下,没有正确的目标,但一个共同的先决条件是系统的行为表达了一个连贯的政策:从情境到判决的映射是不变的,同时情境的道德相关特征被保留,并且在它们发生变化时敏感。我们引入了这种连贯政策的四个结构性条件:判决稳定性、单调性、果断性和帕累托可行性。它们共同衡量了一种道德能力的形式,这种道德能力可以仅根据行为进行评估,而不参考道德标准或专家基线,从而形成了一致性的结构基础,而不是规范性目标。我们展示了三种模拟部署的方法,其中基于 LLM 的智能体面临道德困境。在五个释义、五个升级级别和三个主导条件的因子设计下评估九个前沿模型,我们发现没有一个模型能够在三个部署中表达一致的策略:仅表面形式扰动就可以在单个升级级别上产生高达 99 个百分点的判决率变化,并且模型在一种情况下的成功并不能预测其在另一种情况下的能力。这表明基于 LLM 的智能体目前并不是可以有意义地应用对齐的对象。
