论文

作为交互式证明的人类大语言模型审议:没有透明度的可验证性条件

Human-LLM Deliberation as Interactive Proof: Conditions for Verifiability Without Transparency

模型推理推理验证与自校正

摘要

当大语言模型提供了用户无法轻易构造的论点时,用户如何决定是否接受其主张?受交互式证明的启发,我们将人类大语言模型审议建模为具有不受限制的内部搜索的证明者与资源有限的人类验证者之间的交互。验证者请求并检查支持详细信息,而无需访问 LLM 的内部状态。通过的检查会积累证据以达到接受阈值。我们针对自适应证明者证明了任何时候有效的可靠性:如果任务提供了错误传递和人工检查错误的界限,并且在每个相关历史记录之后仍然有效,那么接受错误声明的概率至多是选定的错误级别。有限范围的完整性边界还需要诚实响应的充分性和足够的诊断进展的边界。进一步的检查可以加强接受的证据,但每一项都需要足够的响应和可靠的人力。这种权衡是否允许认证取决于验证者的工作预算、认知负荷、专业知识和疲劳。我们确定所提供的边界在相同资源预算下证明指定的本地检查序列但不证明指定的全局检查的条件。