论文
用于主动体现安全的自我进化即时内存
Self-Evolving Just-In-Time Memory for Proactive Embodied Safety
摘要
虽然视觉语言模型(VLM)使实体代理能够执行复杂的家务任务,但它们很难在闭环交互过程中主动处理动态出现的危险。现有的安全方法通常依赖于运行时护栏来阻止不安全行为或引起过度谨慎,这严重阻碍了任务进度,而不是积极解决潜在风险。为了打破这种安全与进步的权衡,我们引入了自我进化即时记忆框架,该框架将体现安全从阻碍进度的护栏重新构建为主动缓解危险。该框架由一个足够风险的拓扑信念图(RSG)组成,用于在部分可观察性下持续进行安全相关状态跟踪,一个用于精确危险预测的基于机构的事实记忆,以及一个注入程序元技能来指导可执行的、保留进度的缓解措施的经验记忆。此外,我们提出了一个自动化的测试-验证-写入循环,允许代理在测试时根据执行跟踪不断完善其缓解元技能。 IS-Bench 上的实验表明,我们的框架极大地提高了多个 VLM 主干的安全成功率(例如,Qwen3-VL-8B 上的安全成功率+30.3%),使代理能够主动减轻危险,而不会阻碍任务进度。代码可在 https://github.com/DyMessi/JIT-Memory 获取。