论文
ComplLLM:微调 LLM 以发现面向决策的互补信号
ComplLLM: Fine-tuning LLMs to Discover Complementary Signals for Decision-making
摘要
当互补性成立时,多智能体决策流水线可以优于单智能体工作流,即不同的智能体各自带来独特信息以支撑最终决策。我们提出 ComplLLM,一个基于决策论的后训练框架,它以互补信息作为奖励来微调决策辅助 LLM,使其输出能补充既有智能体决策的信号。我们在涉及领域专家的合成任务与真实任务上验证 ComplLLM,展示该方法如何恢复已知的互补信息,并生成对互补信号的合理解释以支持下游决策者。
