论文
STT-Arena:更真实的时空动力学工具使用环境
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
摘要
部署在现实世界代理应用程序中的 大语言模型 (LLM) 必须能够在任务中期中断使其先前的决策失效时重新规划和适应。现有的动态基准主要衡量 LLM 是否能够及时检测时间变化,而时空动态下自适应重新规划的补充挑战在很大程度上尚未被探索。我们推出了 STT-Arena(时空工具使用竞技场),它是涵盖 9 种时空冲突类型和 4 个可解决级别的 227 个高质量交互任务的基准。每个任务都基于一个现实的、可执行的环境,配备了注入的时空触发器,可以突然使正在进行的计划失效,迫使模型检测状态转变并构建修改后的执行策略。对前沿 LLM 的广泛评估表明,即使是包括 Claude-4.6-Opus 在内的 SOTA 专有模型,整体精度也低于 40%,凸显了时空动态推理的根本难度。对故障轨迹的系统分析揭示了现有模型的三种重复出现的错误模式:陈旧状态执行、动态触发器误诊和缺少适应后验证。在这些发现的指导下,我们提出了一种迭代轨迹细化技术,从训练数据中消除这些故障模式,并将其与在线强化学习相结合,生成 STT-Agent-4B,其在 STT-Arena 上的性能优于前沿 LLM。