论文

通过人机交互实现高效测试时适应

Efficient Test-Time Adaptation through Human-AI Interaction

模型训练上下文与知识持续学习记忆Agent记忆

摘要

人工智能代理接受人口规模数据的训练,以编码涵盖许多从业者的广泛能力。然而,他们生产的艺术品很少能满足私人酒吧专业人士赖以声誉的需要。在现实的、开放式的任务中,成功标准各不相同且记录不充分,个人的专业知识恰恰取决于平均水平的提高和偏离。在实践中,迭代的人机交互表面了用户无法预先完全指定但在任务中重复应用的标准。我们认为这种跨会话交互数据是一个丰富的、未被充分利用的信号,可以缩小与个人专业知识的差距。在这项工作中,我们提出通过人机交互(TAHI)进行测试时间适应,它将这些信号集成到代理上下文和权重中,并通过不断发展的标题模块具体化每个用户的训练和评估标准。我们让智能体适应写作和视觉创作这两个高效用领域的 30 个人,完成总共 600 项任务。我们的智能体仅在数十个任务中就将单独任务的成功率提高了 4.5-20.9%。与此同时,我们不断发展的评分标准模块充当了可扩展的注释工具,创建的评估评分标准比仅来自 LM 或人类的失败率高出 16.0-22.3%。虽然代理针对个人进行了调整,但我们表明这些个性化代理还可以将成功率提高高达 8.8%,并且适用于所有用户。

通过人机交互实现高效测试时适应:论文配图
图1 使用我们与不断发展的核查模块接口的人体-智能体互动过程说明。智能体执行任务,而人则通过四个模块提供指示、建议和纠正:计划调整(A)。计划),输出文件编辑(B)产出、可交付性、文字反馈(C.信息)和标准规格(D.经常预算: 预算外:人类和智能体在此指令-执行环上循环,以改善交付品(标准1 ) , 直到人类对它满意(底部)。同时,核查模块通过整合以前迭代产生的人类信号、更新标记以捕捉人类的偏好而演变。