论文

ComplLLM:微调 LLM 以发现面向决策的互补信号

ComplLLM: Fine-tuning LLMs to Discover Complementary Signals for Decision-making

模型训练强化学习

摘要

当互补性成立时,多智能体决策流水线可以优于单智能体工作流,即不同的智能体各自带来独特信息以支撑最终决策。我们提出 ComplLLM,一个基于决策论的后训练框架,它以互补信息作为奖励来微调决策辅助 LLM,使其输出能补充既有智能体决策的信号。我们在涉及领域专家的合成任务与真实任务上验证 ComplLLM,展示该方法如何恢复已知的互补信息,并生成对互补信号的合理解释以支持下游决策者。

ComplLLM:微调 LLM 以发现面向决策的互补信号
图1:以图形方式展示我们的工作如何超越仅仅识别文本中出现的概念或对目标状态具有预测性的信号,还进一步确保这些信号与现有推荐互为补充。斜条纹(斜纹图案)表示对应方法所瞄准的目标。