论文

AEMA:面向可信赖、受控 Agentic LLM 系统的可验证评估框架

AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems

模型评测评测方法与指标

摘要

评估基于大语言模型(LLM)的多智能体系统仍是一项关键挑战,因为这些系统必须在不断演化的任务上展现可靠的协调、透明的决策与可验证的性能。现有评估方法往往局限于单次响应打分或狭窄基准,在企业环境的多智能体规模下部署时缺乏稳定性、可扩展性与自动化。我们提出 AEMA(Adaptive Evaluation Multi-Agent),一个过程感知、可审计的框架,在人类监督下对异构智能体工作流进行多步骤评估的规划、执行与聚合。与单一 LLM-as-a-Judge 相比,AEMA 实现了更高的稳定性、与人类更一致,并提供支持可问责自动化的可追溯记录。我们在以真实业务场景模拟的企业风格智能体工作流上的结果表明,AEMA 为基于 LLM 的多智能体系统的负责任评估提供了透明且可复现的路径。关键词:Agentic AI、多智能体系统、可信赖 AI、可验证评估、人类监督。

AEMA:面向可信赖、受控 Agentic LLM 系统的可验证评估框架
图2:30 次评估中最终分数的稳定性。AEMA 表现出比单个 LLM-as-a-Judge 更低的离散度。