论文

没有性格的功能性情感:大型语言模型、亚里士多德倾向和行为一致性的局限性

Functional Emotion Without Character: Large Language Models, Aristotelian Disposition, and the Limits of Behavioral Alignment

模型评测评测方法与指标

摘要

关于人工系统是否有感觉的争论常常被迫在两个令人不满意的立场之间进行:行为等价被视为情感的充分条件,或者现象意识被视为使问题在经验上无法解决的先决条件。本文开发了一种结构替代方案。它将情感建模为高维表征状态空间中的上下文敏感区域、轨迹和吸引子动态。最近的机械可解释性发现支持大型语言模型中存在因果活跃的情感概念表示,但它们没有建立主观感觉或完整的情感代理。根据已发布的语言模型表示充分性标准进行评估,干预提供了因果使用的有力证据,而充分的情感角色整合、跨学科领域的一致性和连贯性仍然只是部分建立;没有准确度的直接类似物。这些不匹配暴露了对情感适当性标准的需求,而对性格的描述必须提供这一标准。这样的解释还需要三个进一步的条件:赋予效价内生风险的监管体现、允许情感事件累积成历史的时间连续性、以及将历史与持久价值观结合起来的综合自我模型。亚里士多德的路径、hexis、mesotēs 和 phronēsis 的概念被转化为状态空间草图,其中实践智慧包括估计规范显着上下文的能力,而不仅仅是根据已经给出的上下文描述采取行动。该框架将对齐重新定义为持久处置问题而不是输出一致性问题,并产生具有明确控制条件的干预测试。