AsymmetryZero:将人类专家偏好作为语义评估进行操作的框架
AsymmetryZero: A Framework for Operationalizing Human Expert Preferences as Semantic Evals
摘要
如今 RL 的重点是评估设计:构建有意义的评估,同时作为 后训练 的基准和明确定义的奖励信号。然而,许多现实世界的任务都受到主观、程序和特定领域要求的控制,这些要求很难编码为当今强化学习管道中常用的精确匹配目标或开放式偏好判断。在这项工作中,我们提出了 AsymmetryZero,一个将人类专家偏好操作为语义评估的框架。 AsymmetryZero 将每个任务表示为一个稳定的评估合约,使评分标准变得明确:正在评分的内容、如何判断每个标准以及如何将标准级别的决策聚合为任务结果。可以使用 Inspect 进行仅模型评估,以及使用 Harbor Framework 进行代理评估来执行相同的合同,从而在两种设置中实现可比较的分数和共享审计工件。我们认为,今天 后训练 的核心挑战是将专家要求忠实地编码到评估本身中。为此,我们使用 Harbor 进行了一项研究,该研究固定了任务契约,并将五模型前沿陪审团与五模型紧凑陪审团在四个前沿级求解器(Claude Opus 4.6、GPT-5.4、Grok-4.20、Gemini-3.1-Pro)上进行比较。我们发现,标准级别的前沿与紧凑协议范围从 $75.9\%$ 到 $89.6\%$(严格的公共子集协议:$77.8\%$ 到 $92.1\%$),而紧凑陪审团表现出比前沿陪审团更高的内部异议(3--2 分割率 $28.7\%$--$32.4\%$) ($6.1\%$--$11.5\%$)。验证者跟踪进一步表明,紧凑的陪审团将每个标准的判断成本降低到大约 $4.2\%$--$5.6\%$ 的边界,并将延迟降低到大约 $21.7\%$--$27.1\%$,即使汇总的任务级结果通常保持相对稳定。