论文

XChoice:LLM 约束选择决策中 AI-人类对齐的可解释评估

XChoice: Explainable Evaluation of AI-Human Alignment in LLM-based Constrained Choice Decision Making

模型评测评测方法与指标

摘要

我们提出 XChoice,一个用于评估约束决策中 AI-人类对齐的可解释框架。XChoice 不止于准确率、F1 分数等结果一致性,而是将一个机制化的决策模型拟合到人类数据与 LLM 生成的决策上,恢复出捕捉决策因素相对重要性、约束敏感性与隐含权衡的可解释参数。对齐通过比较跨模型、选项与子群的这些参数向量来评估。我们以美国人每日时间分配为例演示 XChoice,采用美国时间使用调查(ATUS)作为人类真值,揭示各模型与活动之间异质的对齐情况,以及集中于黑人与已婚群体的显著错位。我们进一步通过不变性分析验证 XChoice 的稳健性,并用检索增强生成(RAG)干预评估针对性缓解。总体而言,XChoice 提供基于机制的指标,能够诊断错位并支持超越表面结果匹配的知情改进。

XChoice:LLM 约束选择决策中 AI-人类对齐的可解释评估
图1:使用 ATUS 数据进行 XChoice 评估的端到端流程