论文

一种事后辩论裁判理论

A Theory of Post-hoc Debate Judgement

模型评测评测方法与指标

摘要

辩论近来已成为智能体AI的一种有用方法论,既可提升性能,也有助于可解释性和用户参与。例如,由LLM驱动的智能体可以在内部(与自己)和/或外部(与其他智能体)辩论。在许多使用辩论的场景中,辩论结果与由此产生的输出由外部裁判事后决定,裁判通常是LLM。本文针对所有智能体通过为自己观点提供正反论据而展开辩论的场景,开发并检验了一种新的辩论裁判理论。具体而言,我们识别出辩论裁判通常需要满足的一系列形式性质,涉及可复现性、鲁棒性、有据性和可解释性。然后,我们针对声明验证场景,对两种具体的替代性辩论裁判方法——LLM-as-a-judge思想的变体与源自计算论辩的形式语义——以形式和/或实验方式考察这些性质的满足情况。我们表明,两种方法的准确率表现相近,但前者可能缺乏后者所具备的形式保证。总体而言,我们的研究表明,论辩语义是辩论驱动AI中原则化裁判的理想候选。

一种事后辩论裁判理论:论文配图
图2:事后辩论判断概览:n≥1个智能体(A1,…,An)就输入(论断)I在m≥1个时间步上进行辩论。在时间步t∈{1,…,m},智能体Ak(k∈{1,…,n})产生意见Ok^t,由解释(正反理由)Ek^t和输出(立场)yk^t组成;然后,一个裁判给出判断(立场)J,该判断由应用于输入及从辩论中抽取的O1,…,On的判断方法c决定。在每个时间步t,智能体可以对共享解释Et作出贡献,进而汇入O1,…,On。在每个时间步,每个智能体都能看到其他智能体在上一个时间步的意见,并相应调整自己的意见。