论文

R2IF:通过可解释的 LLM 函数调用的复合奖励使推理与决策保持一致

R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling

模型训练强化学习

摘要

函数调用使 大语言模型 (LLM) 能够与外部工具交互,但现有的基于 RL 的方法存在推理过程和工具调用决策之间不一致的问题。我们提出了 R2IF,一种用于可解释函数调用的推理感知 RL 框架,采用集成格式/正确性约束、思想链有效性奖励 (CER) 和规范修改值 (SMV) 奖励的复合奖励,并通过 GRPO 进行优化。 BFCL/ACEBench 上的实验表明,R2IF 的性能优于基线高达 34.62%(BFCL 上的 Llama3.2-3B),平均 CoT 有效性为正值(Llama3.2-3B 为 0.05),提高了函数调用的准确性和可解释性,以实现可靠的工具增强型 LLM 部署。