面向AI安全的情感代价函数:教会智能体感受不可逆后果的分量
Emotional Cost Functions for AI Safety: Teaching Agents to Feel the Weight of Irreversible Consequences
摘要
人类从灾难性错误中学习,靠的不是数值惩罚,而是重塑自我的质性痛苦。当前的AI安全方法完全没有复制这一点。奖励塑造捕捉的是幅度,而非意义。基于规则的对齐约束行为,却不改变行为。我们提出情感代价函数(Emotional Cost Functions),这是一个让智能体形成质性痛苦状态(Qualitative Suffering States)的框架——它是对不可逆后果的丰富叙事表征,会向前持续存在并主动重塑智能体的性格。与数值惩罚不同,质性痛苦状态捕捉所失去之物的意义、由此造成的特定空洞,以及它如何改变智能体与类似未来情境的关系。我们的四组件架构——后果处理器(Consequence Processor)、性格状态(Character State)、预期扫描(Anticipatory Scan)与故事更新(Story Update)——立足于一条原则:行为无法撤销,智能体必须承受自己造成的后果。预期性恐惧通过两条途径起作用。经验性恐惧源于智能体自身亲历的后果。前经验性恐惧则无需直接经验,通过训练或智能体间传播获得。二者共同映照了人类智慧如何借助经验与文化得以积累。覆盖金融交易、危机支持与内容审核的十项实验表明,质性痛苦产生的是具体的智慧,而非泛化的瘫痪。智能体对适度机会的正确应对率达90-100%,而数值基线的过度拒绝率达90%。架构消融证实该机制必不可少。完整系统在每次探测中生成十条个人化根基短语,而原生LLM为零。统计验证(N=10)证实其可复现性达到80-100%的一致性。