论文

JAF:评审智能体森林

JAF: Judge Agent Forest

模型推理推理验证与自校正

摘要

评审智能体是agentic AI框架的基础:它们提供自动化评估,并支持推理过程的迭代式自我精炼。我们提出JAF:Judge Agent Forest,一个让评审智能体对主智能体生成的一组查询-响应对进行联合推理的框架,而非逐个孤立评估。这一范式把评审者从局部评估者提升为整体学习者:通过同时评估相关响应,评审者能辨识跨实例的模式与不一致性,其聚合反馈使主智能体得以通过评审者的集体视角审视自身输出而改进。概念上,JAF连接了信念传播与集成学习原理:重叠的上下文邻域诱导出有助于批评传播的知识图结构,而重复、随机化的评估产生稳健的情境敏感判断集成。JAF可完全通过ICL实例化,评审者针对每个查询,以其关联的主智能体响应加上一个小的、可能含噪的同伴示例集作为提示。虽然嵌入空间中的kNN是选择示例的自然起点,但该方法忽视了类别结构、领域元数据或现代LLM可辨识的细微差别。为克服这些局限,我们开发了一种灵活的局部敏感哈希(LSH)算法,通过整合语义嵌入、LLM驱动的哈希谓词、类别标签监督与相关辅助信息来学习信息性二值码。这些哈希码支持高效、可解释且关系感知的多样性示例选择,并进一步优化CoT推理路径的探索。我们以大规模云环境中云配置错误分诊这一高难度任务的实证研究验证JAF。

JAF:评审智能体森林
图5:在 JAF 中如何利用 LSH 引导探索多样化思维链(CoT)的概念图(Snell et al., 2025a;Wang and others, 2025a;Muennighoff et al., 2025;Garg et al., 2023a)。树中每个节点表示某条查询的部分或完整推理路径;这些路径被嵌入,并依据其语义与过程特征哈希为二进制码(例如 000, 001, …, 111)。包含许多 CoT 的桶对应被频繁探索的推理风格,而稀疏的桶则捕捉探索不足或非典型的策略。通过监测哪些哈希码采样不足以及它们与评判质量的相关性,JAF 可以将额外的测试时计算分配到推理空间中有前景但较少访问的区域,可选择性地使用强化学习(Kirkpatrick and others, 2024;Dimakopoulou and Van Roy, 2018)来学习探索策略。这使系统能够在利用已知良好的推理模板与探索新模板之间取得平衡,而这一切都在一个与查询和 CoT 上涌现的知识图谱相一致的、由 LSH 组织的原则性框架内完成。