论文
面向可信大模型、智能体与多模态系统的统一评估框架
A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems
摘要
仅凭基准分数不足以评估现代人工智能系统的可信度。大语言模型、智能体系统与多模态模型需要不同形式的评估,但其评估证据仍须能被开发和监督环节理解。我们提出统一框架,通过能力、鲁棒性、安全、公平、透明、治理、监督与效率八个可信度维度,连接输出级、轨迹级和跨模态评估。该框架保留系统专属指标,同时将原生测量映射到共同性能区间,并附上不确定性估计与可追溯证据。元评估层检查评估自身的有效性、可靠性和可复现性。多维画像揭示优势与弱点,安全关键覆盖规则则防止综合分数掩盖严重失效。与治理框架、国际标准及欧盟监管要求的映射,将技术评估与监督需求相连接。该框架为同时评估系统表现及其支撑证据的可信性提供结构化基础,而跨部署场景的实证验证仍是必要的下一步。
