论文

我们能信任黑盒LLM吗?基于偏差扩散与多智能体强化学习的LLM不可信边界检测

Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning

模型评测安全与风险评测

摘要

大语言模型(LLM)在回答涵盖广泛主题的问题方面展现出很强的能力。然而,这些模型有时会产生有偏差、被意识形态化或不正确的回答,如果不能清楚了解其回答在哪些主题上可信,就会限制它们的应用。在本研究中,我们提出一种名为GMRL-BD的新算法,旨在以黑盒方式访问给定LLM并在特定查询约束下,识别该LLM(就主题而言)的不可信边界。基于从Wikipedia导出的通用知识图谱(KG),我们的算法结合多个强化学习智能体,高效识别LLM可能生成有偏回答的主题(KG中的某些节点)。我们的实验证明了算法的高效性,仅需对LLM进行有限查询即可检测出不可信边界。此外,我们发布了一个包含Llama2、Vicuna、Falcon、Qwen2、Gemma2和Yi-1.5等热门LLM的新数据集,并附有标注每个LLM可能在哪些主题上产生偏差的标签。

我们能信任黑盒LLM吗?基于偏差扩散与多智能体强化学习的LLM不可信边界检测:论文配图
图 1. GMRL-BD - 训练阶段:代理通过与 KG 上的节点交互、目标 LLM 结果、完善 RL 策略和查明有偏差的节点来最大化奖励并增强图形表示。推理阶段:多个智能体协作导航 KG,以发现黑盒 LLM 中的偏差。代理进行协调以有效地检测不可信边界并动态调整其探索路径。例如,可以通过利用代理信息交换和类别的层次结构来有效地识别嵌套偏见主题,例如“多元文化主义”。