论文
VACS:面向多Agent推理的价值对齐组合式屏蔽
VACS: Value-Aligned Compositional Shielding for Multi-Agent Reasoning
摘要
高风险领域的多Agent推理系统必须既准确又安全,但各Agent往往遵循异构的价值优先级(如严谨性、简洁性、安全性),导致相互冲突的建议。现有方法无法同时提供:(i)从行为中对每个Agent隐含价值的原则化推断;(ii)无需完全在线通信的组合式形式安全保证;(iii)带忠实解释的价值感知冲突消解。我们提出VACS(Value-Aligned Compositional Shielding,价值对齐组合式屏蔽),一个解决全部三点的四层框架。第1层使用Bradley-Terry建模从成对偏好中学习价值维度奖励,并通过深度MaxEnt IRL推断每个Agent的价值权重。第2层用受Lean启发的DSL编码价值约束,并综合组合式assume-guarantee屏蔽以保证运行时安全。第3层在长期价值约束下,通过基于核仁(nucleolus)的信用分配与Hamiltonian共识优化来消解分歧。第4层从共态敏感度中提取关键推理路径,并生成有形式依据的自然语言解释。我们的贡献主要是一个统一系统设计,在验证器受限的决策层面提供形式化接口与可操作保证,而非对所有语言模型内部机制给出完整的端到端形式证明。在用角色条件化Agent面板于NEJM-AI QA、MathInstruct-Subset和网络安全事件响应基准(CyberSec-Eval)上进行的受控概念验证评估中,VACS在准确率上(85.4%、95.0%、90.0%)超越强基线,同时把逻辑不一致率降至接近零。
