论文
通过论证分析衡量AI问责性:模型推理能否经受审查
Measuring AI Accountability Through Argumentation Analysis: Can Model Reasoning Withstand Scrutiny?
摘要
人工智能监督方法依赖于真实情况进行验证,但什么构成适当的人工智能行为仍存在争议。这使得大语言模型的道德推理评估和基于辩论的监督隐含地避免了现实的模糊性。我们研究了一种旨在克服这种模糊性的替代标准:模型可以为其针对关键问题的判决而进行的辩护的结构质量,通过基于沃尔顿的论证方案理论和戈维尔的论证说服力标准的四阶段辩证协议来衡量。该协议适应不同的推理框架,超越多项选择框架,并处理判决之前的推理及其事后理由。在 9 个前沿模型和 200 个高度模糊的 MoralChoice 项目中——法官评分为 6,778 美元的单元格,根据二元失败判断的 89.6%$ 法官间协议进行验证——模型在每个维度上都证明了自己的推理远高于评分标准的最低标准。失败集中于理由和充分性,并与认知对冲而不是论证长度相关。在每个模型和每个戈维尔维度上,推理都比事后论证得到了更好的辩护。尽管基于价值的实践推理在两个方面都占主导地位,但模型在其论证中提出的方案不同于它在大部分困境中推理的方案(每个模型 $\geq 20\%$)。该协议抓住了严格站不住脚的防御(自相矛盾、错误前提),并且在描述人工智能对齐中撤回的作用方面遇到了困难,这表明需要进行更多的情境评估。
