Safin-1:通过记忆原生状态演化实现内在安全
Safin-1是一系列旨在将安全能力直接融入模型内部计算的基础模型,而不是完全依赖外部防护机制或训练后的对齐。其核心架构MARCH(Memory-Anchor Routing across Context History)维护结构化记忆状态,并从历史上下文中选择性检索相关信息。持久化的能力状态可以在测试时进行调整,无需反复修改模型主干,从而支持受控的专门化。使用专门Safety State的实验显示,模型在下游安全任务上的表现有所提升。研究还评估了一般能力、长上下文理解、信息检索和效率。不过,作者强调这只是早期架构探索,要实现状态原生且可持续维护的安全能力,仍需要大量后续研究。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。