论文

当聚合对齐误导时:无逐状态专家动作的政策修复审计

When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

智能体系统Agent任务评测

摘要

智能体AI系统日益被用于编辑、精炼与修复决策政策——但在无逐状态专家动作标签时评估这些编辑很困难。我们在酒店定价模拟器中研究该问题——智能体政策编辑器仅接收区域级诊断反馈:其价格分布与基准政策跨时间、库存与市场区域的差异摘要。编辑器无法观察基准动作、基准源码、奖励数字或留出结果——且仅可对目标动作表提出受限编辑。在5,000个留出episode上——多重启LLM编辑器达到RevPAR 108.47(95% CI 107.61-109.34)——接近基准政策的108.75(107.81-109.68)——配对差距(LLM减基准)-0.276、95% CI [-0.692, 0.146]。廉价的诊断投影已恢复大部分收入(107.90)——所以LLM编辑器的独特增益不只在原始收入提升:它还将episode构成距离从1.153降至0.609——这是最强的非基准修复结果。该表现不能仅由重启搜索解释:最多2,500次评估的非语义提议者落后8.77-14.57 RevPAR点。也不能由貌似合理的提示格式解释:打乱诊断的对照破坏区域-错误对应并跌至RevPAR 94.30。匹配是真实的但部分的:树编辑器取得更强的池化对齐(0.214对0.266)与更强的参照态D1(0.328对1.197)——但收入降至98.91。这些结果表明智能体政策修复应以诊断反馈是否成为可靠的闭环结果来评估——而非以单一行为距离评估。