论文

辩论中的人工智能安全受到认知偏见的影响

AI Safety via Debate is Compromised by Cognitive Biases

模型评测安全与风险评测

摘要

来自人类反馈的强化学习 (RLHF) 在使大语言模型响应人类指令方面发挥了核心作用。然而,人类评估者通常更喜欢奉承或有说服力的回应,而不是真实的回应,从而激励模型以牺牲准确性为代价来吸引评估者。通过辩论实现人工智能安全已被提议作为改善语言模型监督的一种方式:在这种范式中,两个智能体提出相反的立场并挑战彼此的主张,可能会向裁决者揭露谎言。通过辩论实现人工智能安全的一个核心前提是,在对抗性审查下,真实的参数比虚假的参数更容易辩护。在这项工作中,我们研究了当辩手使用利用人类判断偏差的修辞策略时,这种优势是否持续存在。受竞争性辩论的启发,我们构建了 68 个由LLM生成的对话,内容涉及已知罪魁祸首的侦探悬疑小说,涵盖四种干预措施:锚定、谬误监督、专业行话和冗长。我们将每次干预应用于主张真凶的一方或主张无辜嫌疑人的一方,从而使我们能够区分对裁决的影响与正确性。在一项对 369 名参与者进行的研究中,我们发现,综合各种偏见类型,这些干预措施显着地将判断转向了被操纵的一方。这些发现暴露了基于辩论的监督的一个弱点:人类的裁决对操纵性修辞策略很敏感。

辩论中的人工智能安全受到认知偏见的影响的原论文方法或结果图
图 4:插画家 Michele Rosenthal 于 2017 年 2 月设计的海报,用于在课堂上教授逻辑谬误 [42]。 2020 年,网络开发人员 Thom Hines 将其变成了一个交互式网站,“希望提高在线讨论的质量”。它可以在 Fallacy Detected 网站上找到:https://fallacyDetected.com/。