论文

从外部推断贝叶斯智能

Bayesian Intelligence from the Outside

模型评测评测方法与指标

摘要

从可观察行为推断智能是人工智能中的基础挑战。我们为语言模型等智能体构建了贝叶斯智能理论。每个提示会引发一次可能不完美的内部实验;智能体通过贝叶斯法则更新全支持先验,并忠实报告其对可能答案的后验概率。重复提示会从同一未观测实验的固定状态中抽样得到新的独立结果。我们证明,智能体行为可被上述机制解释的充要条件是其报告之间不完全矛盾,即在所有提示下,总存在某种状态在每份报告中仍可能被保留。报告频率和正概率值的大小不施加额外限制。我们进一步提出并刻画了一种智能体间的智能顺序:若一个智能体能访问比另一个更丰富的实验信息,则其行为应满足存在一种报告分布的耦合,使得更信息丰富的智能体的报告排除了其对应智能体所排除的每一个答案。最后,我们指出聚合智能体粗粒度报告的困难:除非智能体报告了对世界完整状态的信念,最优聚合方法可能对未被排除的状态赋予任意权重。这些结果为理解智能体行为何时体现智能提供了基础,并突显了拒绝贝叶斯理性所面临的困难。