论文

MatrAIx:用83亿人格Agent模拟世界

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

模型评测基准与评测资源

摘要

人类对人工智能系统和数字产品的评估成本高、速度慢且难以扩展。离线评估虽然更易于扩展,但通常会忽略人类的多样性与交互行为。因此,我们引入了MatrAIx,这是一种用于测试具有不同用户的人工智能系统和数字产品的人口规模模拟用户评估基础设施。MatrAIx 包含三个核心组件:首先,Persona 8B 包含 8.3 亿个 persona 记录,这些记录由 1,290 维度的类别维度表示。记录要么是从依赖图中采样以保留相关属性,要么从人类撰写的个人资料中生成。我们公开了一个质量过滤后的子集,包含约 100 万 persona,其中包括 599,847 个基于人类背景和 400,000 个合成记录的人类基础 persona 和 599,847 个合成 persona。其次,MatrAIx Playground 提供了四个环境,在这些环境中,不同用户可以评估并与数字产品互动:调查、AI 聊天机器人、网页和应用。第三,MatrAIx 提供了 1,010 项应用任务,覆盖超过 25 个领域,包括电子商务、软件开发、金融和医疗保健。我们进行了 18,189 次评估试验,涵盖八个代表性任务。Persona 代理由三个大语言模型(Claude Opus 4.8、GPT 5.5 和 Claude Haiku 4.5)驱动。结果反馈捕捉了决策与偏好在 persona 背景下随时间变化的情况,包括价格增加后的犹豫、AI 辅助失败后继续意愿和延迟容忍度。我们进行了两个主要验证研究:首先,一项 400 次试验的控制性研究评估了十种行为属性和所有四个环境中的 persona 遵守情况。声明的行为在 366 次试验中正确表达或被正确抑制(91.5%)。其次,人类与大语言模型的评委对基于人类背景的人类基础 persona 的提取质量进行了评价。总体而言,MatrAIx 提供了一种评估具有不同模拟的人类用户的人工智能系统和数字产品的完整端到端基础设施。

MatrAIx:用83亿人格Agent模拟世界:论文配图
图 1:MatrAIx 模拟用户评估框架概述。评估者描述目标受众,MatrAIx 从 Persona 8B 中检索匹配的人物角色以形成评估队列。这四种环境定义了这些角色代理如何交互,而 MatrAIx 应用程序提供了它们执行的任务规范。共享遥测和任务拥有的验证保留了亚组和人群级别报告所需的证据。