论文

ARGUS:通过对抗性裁判不断强化的政策自适应广告治理

ARGUS: Policy-Adaptive Ad Governance via Evolving Reinforcement with Adversarial Umpiring

智能体系统Agent 协作

摘要

由于监管政策的非平稳性,在线广告治理面临着重大挑战,其中新出现的指令(例如,对教育或审美焦虑的限制)在历史数据集中造成严重的标签不一致和推理模糊性。在本文中,我们提出了 ARGUS,这是一种政策自适应治理系统,可以通过多主体对抗性裁判来不断强化。 ARGUS 通过采用三阶段框架来解决新政策数据的稀疏性问题:(1) 政策播种以实现初步感知; (2) 对抗性标签纠正,利用“检察官-辩护人-裁判员”架构来解决过时标签与新任务之间的冲突; (3) 潜在知识发现,采用三方辩证讨论来挖掘复杂的“灰色地带”违规行为。通过利用 RAG 增强的政策知识和思想链综合作为强化学习的动态奖励,ARGUS 使其推理路径与不断发展的法规同步。对工业和公共数据集的大量实验表明,ARGUS 的性能显着优于传统的 微调 基线,用最少的黄金数据实现了卓越的策略自适应学习。