论文
Auditopus:抵抗恶意参与方的分布式大模型公平性审计
Robust Decentralized Fairness Auditing
摘要
新兴立法要求对大型语言模型(LLM)进行审核,以确保其符合监管标准,尤其是公平性。这种黑盒审计通常假设单个审计员可以访问大量具有代表性的查询集。在实践中,审核员可能很难获得这样的查询集,但多个审核员可以通过与各自的查询集协作审核LLM来共同覆盖相关的人口统计群体。然而,依赖多名审计师会带来一个根本性的信任问题,因为他们可能代表LLM提供者行事,描绘出一种误导性的公平外观,即公平清洗。我们提出了 Auditopus,这是一种稳健的去中心化公平审计的新方法。在 Auditopus 中,审计是在没有中央服务器的情况下分轮进行的。在每一轮中,每个审核员向LLM发出固定数量的查询,并且仅将其查询结果的累积统计向量发送给其他审核员,而不是明文发送敏感查询。然后通过汇总所有向量来估计经审计的LLM的公平性。我们展示 从理论上和经验上讲,即使网络中的一个对抗性审计师也可以通过伪造其发送的向量来控制这一估计,从而使不公平的LLM看起来公平。为了解决这一威胁,Auditopus 让每个诚实的审计员在本地降低其累积统计向量与以前的统计向量不一致的任何审计员的权重。我们实现了 Auditopus,并将其与两个数据集上具有两个预训练 LLM 的稳健聚合基线进行比较。针对优化其发送的向量以使 LLM 显得公平的攻击者,Auditopus 相对于无防御,平均减少了高达 78% 的审计错误,相对于稳健的聚合基线,平均减少了 62%。即使 49% 的审计员持敌对态度,Auditopus 也不会让非常不公平或中等不公平的LLM被视为公平。
