论文

Sensi:一次只学一件事——面向LLM游戏智能体的课程式测试时学习

Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents

智能体系统Agent 架构与控制循环Agent Harness

摘要

部署在未知环境中的大型语言模型(LLM)智能体必须在测试时学习任务结构,但现有方法需要数千次交互才能形成有用的假设。我们提出Sensi,一种面向ARC-AGI-3游戏挑战的LLM智能体架构,通过三个机制引入结构化的测试时学习:(1)将感知与动作分离的双玩家架构;(2)由外部状态机管理的基于课程的学习系统;(3)使智能体上下文窗口可被程序化调控的“数据库即控制平面”。我们进一步引入带动态生成评估量规的LLM-as-judge组件,用于判定智能体何时已充分学习某一主题并可进入下一主题。我们报告了两轮迭代的结果:Sensi v1仅凭双玩家架构解决了2个游戏关卡,而Sensi v2加入课程学习后解决了0个关卡——但它用约32次动作尝试完成了全部学习课程,样本效率比需要1600-3000次尝试的同类系统高出50-94倍。我们将失败模式精确诊断为起源于感知层的自洽幻觉级联,表明架构瓶颈已从学习效率转移到感知接地(perceptual grounding)——一个更易处理的问题。