论文

面向生成式AI多元对齐的基于人设的评估框架

A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI

模型评测评测方法与指标

摘要

当前生成式人工智能的对齐范式主要依赖单体式的基准框架,将人类判断的多元性简化为聚合的统计基线,从而掩盖了评估中的文化、人口学与情境差异。我们提出一个状态空间约束的AI评估仿真框架,用代表多元人类视角的合成认知档案所构成的结构化流形替代单一评估函数。我们证明现代生成式架构能够以高一致性实例化并维持这些评估性人设,从而实现一种更贴近真实世界共识多样性的多元、依赖视角的基准测试。然而,我们进一步分析了这些模拟评估器在序列推理与随机提示扰动下的稳定性,发现人设一致性会出现系统性退化,表现为状态空间漂移与语义不一致。这些发现表明,静态对齐约束不足以长期维持稳健的评估行为。相反,我们主张必须在生成式系统内嵌入动态的、以存续为导向的调控机制,以保持连贯的认知仿真。通过将基于人设的评估框定为潜表示流形上的结构化动力学系统,本研究为更具适应性、更贴合人类且对情境敏感的AI评估方法奠定了基础。