论文

测量机器:将生成式AI作为多元社会技术系统加以评估

Measuring the Machine: Evaluating Generative AI as Pluralist Sociotechical Systems

模型评测评测方法与指标

摘要

在测量理论中,工具并非单纯记录现实,它们参与建构所观察的对象。生成式AI评估亦然:基准不只是测量,还塑造了模型呈现出的样子。功能主义基准把模型当作孤立的预测器,而规范性方法则评估系统应当是什么。两者都遮蔽了意义与价值得以践行的社会技术过程,在多元语境中有将狭隘文化视角物化固化的风险。本论文提出一种描述性的替代路径。它主张必须将生成式AI作为多元社会技术系统来评估,并发展了Machine-Society-Human(MaSH)循环——一个追踪模型、用户与制度如何递归地共同建构意义与价值的框架。评估由此从评判输出转向考察价值如何在交互中被践行。三项贡献随之展开。概念上,MaSH循环将评估重新框定为递归的、生成性的过程。方法上,World Values Benchmark引入了一种基于世界价值观调查(World Values Survey)数据、结构化提示集与锚点感知评分的分布性方法。实证上,论文通过两个案例加以展示:早期GPT-3中的价值漂移,以及房地产领域的社会技术评估。最后一章借助参与式实在论论证:提示与评估是构成性干预,而非中立观察。论文认为静态基准不足以评估生成式AI。负责任的评估需要多元主义的、面向过程的框架,使「谁的价值被践行」变得可见。因此,评估是治理的场所,塑造着AI系统如何被理解、部署与信任。