论文
GUIDE:从跨轮经验中更新航天器控制规则
GUIDE: Guided Updates for In-context Decision Evolution in LLM-Driven Spacecraft Operations
摘要
大语言模型 (LLM) 已被提议作为航天器操作的监督代理,但现有方法依赖于静态提示,并且在重复执行中没有改进。我们引入了 \textsc{GUIDE},这是一种非参数策略改进框架,它通过发展结构化的、状态条件化的自然语言决策规则手册,无需权重更新即可实现跨轮次适应。轻量级动作模型执行实时控制,而离线反思则根据先前的轨迹更新规则手册。在坎巴拉太空计划差分游戏环境中的对抗性轨道拦截任务上进行评估,GUIDE 的进化始终优于静态基线。结果表明,LLM 代理中的上下文演化在实时闭环航天器交互中充当对结构化决策规则的策略搜索。