用于持续学习的快速权重注意力
该研究分析了递归快速权重记忆和选择性状态空间模型。这些模型将不断增长的上下文压缩到固定大小的递归状态中,并在因果性的读后写语义下把状态转移视为在线学习规则。作者针对平方误差回归和负内积目标推导了归一化更新,涵盖 Falcon-1、Falcon-2、Falcon-3 及其内积变体,同时提供递归、掩码并行和分块并行形式,以及数值稳定的正衰减重新归一化。代表性变体在语言建模中仍具竞争力,并改善了可变位数加法任务中的长度外推能力。该框架区分了时间对齐、可塑性、遗忘和有界重放。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。