论文
要事第一:教导基于 LLM 的智能体优先考虑必需品而不是美好品
First Things First: Teaching LLM-Based Agents to Prioritize Must-Haves before Nice-to-Haves
摘要
多模式 大语言模型 (MLLM) 的最新进展极大地激发了人们对其作为现实世界任务的自主代理的潜力的热情。然而,需要代理满足用户复杂、结构化需求的场景在很大程度上仍未得到充分探索。在这项工作中,我们研究了三种不同需求场景下的推理任务:(i)必须具备的需求唯一地确定了唯一的可行解决方案; (ii) 多个答案满足必备要求,并通过“可有可无”要求确定优先级; (iii) 没有候选解决方案满足必备要求,在这种情况下,代理应放弃生成响应。我们在 3,649 个精心构建的问题上评估了最先进的 MLLM,这些问题反映了现实的服务场景,包括电子商务、预订、基于地图或叫车服务。我们的评估表明,现有的 MLLM 在所有情况下都会出现灾难性故障。他们经常误解任务要求、违反必备要求并产生无效的解决方案。为了解决这一关键差距,我们提出了要事第一的强化学习 FTF-rl,它显式优化了多优先级用户需求的推理。实验结果表明,与强基线相比,我们的方法大大提高了任务成功率。此外,FTF-rl 在流行的逻辑和数学推理任务(包括 LogicVista、MathVision 和 InfoQA)上具有普遍的有效性。我们的研究结果表明,增强需求感知推理能力为提高 MLLM 代理的泛化能力提供了一种简单而有效的途径。代码和数据集可在 https://github.com/claire62/FTF-RL 获取。