论文
语言式试错在经验时代落伍
Language-based Trial and Error Falls Behind in the Era of Experience
摘要
虽然大语言模型(LLM)在基于语言的agentic任务中表现出色,但它们对未见过的非语言环境(如符号或空间任务)的适用性仍然有限。先前工作将这一性能差距归因于预训练分布与测试分布的不匹配。在本工作中,我们证明主要瓶颈是探索的高昂代价:掌握这些任务需要大量试错,而对在高维语义空间中运行的参数量庞大的LLM来说,这在计算上不可持续。为此,我们提出SCOUT(Sub-Scale Collaboration On Unseen Tasks),一个将探索与利用解耦的新框架。我们采用轻量级侦察员(如小型MLP)以远超LLM的速度和规模探测环境动态。收集到的轨迹用于通过监督微调(SFT)引导LLM,随后进行多轮强化学习(RL)以激活其潜在世界知识。经验上,SCOUT使Qwen2.5-3B-Instruct模型达到平均0.86的得分,显著优于包括Gemini-2.5-Pro(0.60)在内的专有模型,同时节省约60%的GPU小时消耗。
