论文

审计 大语言模型 中的专有对齐:没有 真值 标准的比较框架

Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地通过不透明的开发和部署管道发布和部署,使模型提供商能够注入有意的、特定于提供商的策略,而无需正式宣布。因此,据报道,各种模型都会生成反映专有规则和组织利益的响应,从而导致对有争议话题的审查或错误信息。然而,系统地识别这种一致性仍然是一个根本性的挑战,而且由于不同背景下“专有”含义的模糊性而变得更加复杂。在本文中,我们提出了一个统计框架,用于通过比较行为分析来检测黑盒语言模型中的专有对齐。我们的方法量化了共享语义空间中目标模型的响应与基线模型参考集的响应之间的系统偏差。通过评估相对行为差异而不是绝对正确性,我们的框架可以在黑盒访问下进行有原则的审计。它应用于几个广泛讨论但以前未量化的案例,为 大语言模型 中提供商特定对齐行为的外部评估提供了系统且可扩展的基础。