论文

Agent何时以及如何澄清?CIGAsk:用反事实信息增益教LLM提问澄清

When and How Should an Agent Clarify? CIGAsk: Teaching LLMs to Clarify via Counterfactual Information Gain

模型训练强化学习RLVRAgentic RL

摘要

面对欠规范的查询,指令微调的 LLM 往往径自选定单一解释而非请求澄清,产出自信却错误的答案。在我们的实验中,仅靠提示并不够:模型要么对每个查询都请求澄清,要么问出无法找回缺失信息的模糊问题。解决这一失败需要学习两个耦合技能:何时提问而非直接回答,以及如何提出能找回消歧信息的问题。现有方案要么只解决其中一个技能,要么需要单独训练的评判器。我们提出 CIGAsk,一个 RL 配方,在多轮 GRPO 循环中通过两个互补的奖励信号教授这两种技能。反事实信息增益(CIG)比较冻结参考模型在有与没有用户回答时金标准答案的对数似然,提供引导“如何问”的逐轮信用。非对称歧义奖励基于金标准歧义标签在终止 token 上赋予带符号奖励,引导“何时问”。在横跨表格、段落和开放域问答的三个澄清基准上,CIGAsk-7B 尽管骨干更小仍超越最强外部基线;它还能跨数据集迁移而无需逐数据集调参,同时在分布外基准上保持单轮问答性能。