论文

Safin-1:通过内存本机状态演化实现内部安全

Safin-1: Safety from Within through Memory-Native State Evolution

模型架构新型架构

摘要

长期复杂任务需要基础模型来积累信息、维护内部状态并适应扩展的交互。安全性应该是模型本身的固有属性,而不是仅仅依赖于外部保障措施或事后调整(例如受监督的 微调)的行为约束。这激发了“内部安全”,其中通过模型的本机计算来表示和调用与安全相关的功能。我们提出了 Safin-1,这是一个通过内存路由和状态演化实现这一原理的基础模型系列。 Safin-1 建立在跨上下文历史的内存锚路由 (MARCH) 之上,这是一种网络架构,可维护结构化内存状态并通过内容条件路由选择性地检索相关历史信息。它支持持久能力状态的测试时适应,而无需重复修改主干网,从而在共享基础上实现受控的专业化。我们通过安全状态研究下游安全任务的这个接口,展示了有效的基于状态的适应和显着的安全改进。更广泛地说,路由状态接口将上下文记忆和持久能力适应统一在模型的本机计算中,将内存从先前上下文的被动记录重新构建为用于维护和发展模型行为的主动基础。对一般能力、长上下文理解、检索和效率的评估进一步验证了 Safin-1。这些发现提供了一条通向安全作为国家原生和自适应可维护能力的道路。这项工作只是对内部安全的初步架构探索,还需要大量的进一步工作来实现这一更广泛的愿景。