论文

用于负责任的 LLM 作为法官评估的人在环块注释

Human-in-the-Loop Nugget Annotation for Accountable LLM-as-a-Judge Evaluations

模型评测评测方法与指标

摘要

可靠地评估人工智能/代理系统的输出需要人类的判断,但如何结合人类决定是否获得真正高质量的信号或昂贵的影院。常见的方法要么意外地固定了人类专家(导致橡皮图章),要么让他们在认知要求高的标签任务中得不到支持。我们提出了一个注释工具的原型,它实现了不同的分工:人类识别重要的信息(块),而 LLM 处理块与系统输出的大量匹配。这可以发挥各方的优势,同时保持真正的人为监督。我们描述了人类人工智能工作流程、关键设计决策,以及如何将生成的金块库与自动法官一起使用。