论文
通过人机交互实现高效测试时适应
Efficient Test-Time Adaptation through Human-AI Interaction
摘要
人工智能代理接受人口规模数据的训练,以编码涵盖许多从业者的广泛能力。然而,他们生产的艺术品很少能满足私人酒吧专业人士赖以声誉的需要。在现实的、开放式的任务中,成功标准各不相同且记录不充分,个人的专业知识恰恰取决于平均水平的提高和偏离。在实践中,迭代的人机交互表面了用户无法预先完全指定但在任务中重复应用的标准。我们认为这种跨会话交互数据是一个丰富的、未被充分利用的信号,可以缩小与个人专业知识的差距。在这项工作中,我们提出通过人机交互(TAHI)进行测试时间适应,它将这些信号集成到代理上下文和权重中,并通过不断发展的标题模块具体化每个用户的训练和评估标准。我们让智能体适应写作和视觉创作这两个高效用领域的 30 个人,完成总共 600 项任务。我们的智能体仅在数十个任务中就将单独任务的成功率提高了 4.5-20.9%。与此同时,我们不断发展的评分标准模块充当了可扩展的注释工具,创建的评估评分标准比仅来自 LM 或人类的失败率高出 16.0-22.3%。虽然代理针对个人进行了调整,但我们表明这些个性化代理还可以将成功率提高高达 8.8%,并且适用于所有用户。
