论文
DLLM-Searcher:将扩散大语言模型适配于搜索智能体
DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents
摘要
近来,扩散大语言模型(dLLM)凭借其固有的并行解码机制与灵活的生成范式展现出独特的效率优势。与此同时,尽管搜索智能体(Search Agent)发展迅速,其实际部署仍受一个根本性限制的制约,即(1)延迟挑战:在 ReAct 智能体范式下,多轮推理、工具调用与等待工具返回的串行执行会造成严重的端到端延迟。直观上,dLLM 可以利用其独特优势来优化 ReAct 智能体范式下智能体的运行效率。但在实践中,现有 dLLM 主干面临(2)智能体能力挑战:现有 dLLM 的推理与工具调用能力明显薄弱,使这些优势无法在实践中有效兑现。本文提出 DLLM-Searcher,一个面向基于 dLLM 的搜索智能体的优化框架。为解决智能体能力挑战,我们设计了包含 Agentic 监督微调(Agentic SFT)与 Agentic 方差缩减偏好优化(Agentic VRPO)的两阶段后训练流程,以增强主干 dLLM 的信息获取与推理能力。为缓解延迟挑战,我们利用 dLLM 灵活的生成机制,提出一种名为并行推理与行动(P-ReAct)的新智能体范式。P-ReAct 引导模型优先解码 tool_call 指令,从而让模型在等待工具返回时仍能持续思考。实验结果表明,DLLM-Searcher 取得与主流基于 LLM 的搜索智能体相当的性能,且 P-ReAct 带来约 15% 的推理加速。代码发布于 https://anonymous.4open.science/r/DLLM-Searcher-553C
