论文
onPanda:通过词元级别校正为 LLM 和代理提供有效的政策对齐数据注释
onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
摘要
我们推出了 onPanda,一种交互式工具,用于有效注释 LLM 对齐数据和代理轨迹。 onPanda 采用 token 级校正作为其核心交互:在读取模型响应时,注释器找到第一个不合适的 token,然后从模型的候选 token 中选择替代项,或者通过自由格式编辑输入正确的文本。然后,系统会截断该位置之后的所有内容,并从纠正后的前缀继续生成,重复此定位-正确-继续循环,直到获得满意的响应。这种机制可以让注释者以低成本精确控制模型输出:一项小型对照研究表明,onPanda 比手动后期编辑将注释时间中值缩短了 52%。由于最终响应中的绝大多数词元都是由模型本身生成的,因此生成的数据在很大程度上保留了模型的采样分布,并且非常适合构建同策略 SFT 和偏好数据。此外,注释期间记录的标记级更正提供了具有精确位置和自然配对的正负样本的细粒度监督。 onPanda 还连接到外部工具和工具,从而在现实环境中实现交互式轨迹注释。此外,我们还发布了 Panda-CVL,这是一个用 onPanda 注释的数据集,以及用于 token 级别校正的基准。