论文
我们能信任黑盒LLM吗?基于偏差扩散与多智能体强化学习的LLM不可信边界检测
Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning
摘要
大语言模型(LLM)在回答涵盖广泛主题的问题方面展现出很强的能力。然而,这些模型有时会产生有偏差、被意识形态化或不正确的回答,如果不能清楚了解其回答在哪些主题上可信,就会限制它们的应用。在本研究中,我们提出一种名为GMRL-BD的新算法,旨在以黑盒方式访问给定LLM并在特定查询约束下,识别该LLM(就主题而言)的不可信边界。基于从Wikipedia导出的通用知识图谱(KG),我们的算法结合多个强化学习智能体,高效识别LLM可能生成有偏回答的主题(KG中的某些节点)。我们的实验证明了算法的高效性,仅需对LLM进行有限查询即可检测出不可信边界。此外,我们发布了一个包含Llama2、Vicuna、Falcon、Qwen2、Gemma2和Yi-1.5等热门LLM的新数据集,并附有标注每个LLM可能在哪些主题上产生偏差的标签。
