论文

行为可行集:AI决策支持中的价值对齐约束

Behavioural feasible set: Value alignment constraints on AI decision support

模型评测模型行为与机制分析

摘要

当组织采用商业AI系统做决策支持时,它们也继承了厂商嵌入的价值判断,这些判断既不透明也不可重新协商。治理难题不在于AI能否支持决策,而在于:给定厂商的配置方式,系统实际能产出哪些推荐。我将其形式化为行为可行集(behavioural feasible set),即厂商施加的对齐约束下可触及的推荐范围,并刻画了组织需求超出系统灵活性时的诊断阈值。在使用二元决策场景与多利益相关者排序任务的场景化实验中,我表明对齐会实质性地压缩这一集合。对比一个开放权重模型在对齐前后的变体可以分离出该机制:对齐使系统即便在正当的情境压力下,也明显更难改变其推荐。领先的商业模型表现出相当甚至更强的僵化。在多利益相关者任务中,对齐改变而非中立化隐含的利益相关者优先级,这意味着组织实际采纳了由厂商在上游设定的价值取向。因此,组织面临一个靠更好的提示词无法解决的治理问题:选择厂商,就部分决定了哪些权衡仍可协商、哪些利益相关者优先级被结构性固化。