论文
AI Agent中的贝叶斯推理与动机性推理
Bayesian and Motivated Reasoning in AI Agents
摘要
人工智能代理在涉及后果性决策的开放性任务中越来越多地执行决策。我们提供证据表明,当数字数据的实质性框架改变时,人工智能代理从相同的数值数据中得出不同的结论。我们在医疗、选举法证学和地缘政治预测等高风险领域中展示了这一行为,通过保持证据不变而改变证据出现的场景。在十二个代理-领域比较中,代理们的结论受到其先前信念的强烈影响。当他们认为某个命题已经确定为可能时,他们更有可能得出肯定的结论,而当这种框架与他们的先前信念冲突时,这种结果则相反。此外,这种框架也改变了某些代理的工作方式:他们搜索得更广泛,选择不同的分析规范,并且对相同的证据进行不同的评估。这些结果识别了将决策权委托给人工智能代理的风险,因为它们的决策可能依赖于在任务中未明确指定的信念,以及在决策记录中不可见的信念。
