论文

移动众包中 LLM 微调 的真实在线偏好聚合

Truthful Online Preference Aggregation for LLM Fine-Tuning in Mobile Crowdsourcing

模型训练偏好优化

摘要

为了更好地满足用户在移动应用程序(例如导航)中的需求,移动众包平台可以迭代地将 大语言模型 (LLM) 生成的内容(例如 AI 生成的交通状况预测)与从众包工作人员(例如移动用户)收集的人类反馈进行调整。然而,员工可能会策略性地错误报告他们的在线偏好反馈,以最大限度地发挥他们的影响力或报酬。移动众包中的现有流程(例如基于 EM 的权重估计)无法识别在线环境中最准确的工作人员,导致在 $T$ 时段内出现线性遗憾 $\mathcal{O}(T)$。在本文中,我们研究了移动众包中 LLM 微调 的真实在线偏好聚合。我们制定了一种新的动态贝叶斯游戏来模拟平台和战略移动工作​​人员之间的多智能体在线学习过程。我们提出了一种新颖的在线加权聚合机制,可以根据每个工人的反馈准确性动态调整偏好聚合中每个工人的权重。我们证明,我们的机制可确保战略工作者的真实反馈,并在 $T$ 时间段内实现亚线性遗憾 $\mathcal{O}(\sqrt{T})$。我们进一步将我们的机制扩展到具有挑战性的场景,每个时间段的工人反馈有限,仍然保证次线性遗憾$\mathcal{O}(\sqrt{T})$。使用真实数据集对 LLM 微调 进行的实验进一步证明了我们的机制相对于基准方案的显着性能提升。