论文

Goldsmith:以金标准损失引导标注定义优化的Agent Harness

Goldsmith: Gold-Loss-Guided Definition Optimization with an Agentic Annotation Harness

智能体系统模型训练合成数据Agent Harness智能体自我改进

摘要

许多注释项目在专家拥有稳定的指南或足够的标签来训练特定于任务的模型之前就开始了。我们推出了 Goldsmith,这是一个 Agentic 管道,它将小型黄金集(代表预期任务边界的专家注释校准示例)转换为可重用的结构化注释定义。戈德史密斯将此定义视为可训练的文本对象。候选定义在相同的黄金示例上运行,并通过可执行的结构化损失进行评分,而输出模式、格式化、检索、修复、判断和人工审核仍保留在外部工具中。大型语言模型(LLM)编辑器将损失最高的失败转换为文本梯度修订,只有当测量到的损失减少时才接受这些修订。在提示优化比较中,Goldsmith 在匹配的评估协议下比直接重写、OPRO、APE 和 PromptBreeder 进行了改进。当与跨类型跨度、对级关系和检索、基于分数的路由和人工审查相结合时,生成的定义还可以改进下游注释。 固定触发事件参数任务。这些结果表明,稀缺的专家监督可以支持任务定义学习和可扩展注释。

Goldsmith:以金标准损失引导标注定义优化的Agent Harness:论文原图
图 1:数据集优先注释工作流程和 Goldsmith 定义优先工作流程之间的概念比较。