论文

永不停思:连续时间语言智能体

Never Stop Thinking: Continuous-Time Language Agents

模型训练强化学习Agentic RL

摘要

基于大模型的语音智能体遵循僵硬的听—想—说循环,每次回复前出现数秒空白。我们显示,未修改的文本模型在轻量中断恢复编排器下可涌现连续时间认知,即边听边想、边说边想,使实时流水线总体延迟降低19%,在机制针对的运行区间降低一半。为衡量其是否改善任务完成,我们提出ReactiveBench:120个交互场景按预注册二元要求评分,另有按精确正确性评分的可验证流式赛道。基准揭示广泛陷阱:大模型评审奖励可见推理,连续思考在某评审下的大幅优势换独立评审后反转,而按评审训练的模型思考时客观完成要求更少。五阶段训练研究在三个层面定位正确信号。来源层面,可验证目标让思考由有害变有益;结构层面,统一奖励遗漏的东西会被优化牺牲,处处追求简短会削弱多跳工具链;优化器层面,偏好优化只能权衡冲突子目标,而以任务类型塑形奖励进行同策略强化学习可同时改善各正确性维度,使流式完成率从48%升至跨种子73±5%,并在更大规模和第二个模型上复现。编排使连续时间交互成为可能,正确来源、形状和优化的可验证信号使其真正有效。

永不停思:连续时间语言智能体:论文配图
图3:连续时间认知的延迟收益。(a)10道数学题的CPU试验中,双过程使两模型首次响应时间约减少三分之二,而边听边思考在CPU速度下增加延迟。(b)93道真实GSM8K题、Qwen3-4B及每秒3词的模拟语音下,双过程几乎立即响应;边听边思考只有当思考落在语音窗口内时才能完全隐藏耗时,本模型为52%的题,更快的Qwen3-1.7B为88%。(c)20次Whisper→Qwen3-8B→流式TTS实时试验中,从用户说完到首个可听Token的平均延迟减少:早实体任务49%、晚意图计算器任务15%、合并19%,对应95%自助置信区间为[39,66]、[13,19]、[16,25]。