论文
CreditAudit:LLM 评估和选择的 2D 审计
CreditAudit: 2D Auditing for LLM Evaluation and Selection
摘要
公开基准上的排行榜分数持续攀升并趋于收敛,许多前沿语言模型之间的差距已微乎其微。然而,这些分数常常与用户的日常体验不符,因为系统提示词、输出协议和交互模式在日常迭代中不断演变,而在Agentic多步管线中,微小的协议变化可能引发不成比例的失效,使从业者难以确定该部署哪个模型。我们提出CreditAudit,一个面向部署的信用审计框架,它在多个基准上用一族语义对齐且非对抗的系统提示词模板评估模型,报告平均能力(即各场景的平均表现)与场景诱发波动sigma(作为稳定性风险信号),并进一步通过跨模型分位数将波动映射为从AAA到BBB的可解释信用等级,同时提供缓解模板难度漂移的诊断手段。在GPQA、TruthfulQA和MMLU Pro上的受控实验表明,平均能力相近的模型可能表现出显著不同的波动,而在Agentic或高失效成本场景中,稳定性风险可能推翻优先级决策。通过提供二维、基于等级的场景特定选型语言,CreditAudit支持分层部署和更有纪律的测试与监控投入分配,使真实使用中的模型评估更客观、更可信。
