论文

经由模型路由与协作的集体偏差缓解

Collective Bias Mitigation via Model Routing and Collaboration

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型日益部署于公共卫生、金融与治理,同时要求准确性与社会价值对齐。尽管有进展,LLM常延续或放大训练数据中的偏见,对公平构成挑战。自我去偏鼓励LLM识别并纠正自身偏见,但依赖单一模型的内在知识可能不足以应对根深蒂固的刻板印象。为此我们提出集体偏差缓解(CBM):通过学习细粒度模型行为并促进多样LLM间的知识共享来缓解偏见的框架。这是首个系统探索有效选择与组织不同LLM以培育更公平响应的工作。实验显示CBM大幅超越独立基线(如top-7设置下委员会把年龄偏差分从0.25降到0.10);辩论与委员会两种拓扑都实现实质偏差削减,后者平衡缓解效果与推理成本,凸显CBM对更公平LLM的潜力。