原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.27763
立即前往原文

用于持续学习的快速权重注意力

该研究分析了递归快速权重记忆和选择性状态空间模型。这些模型将不断增长的上下文压缩到固定大小的递归状态中,并在因果性的读后写语义下把状态转移视为在线学习规则。作者针对平方误差回归和负内积目标推导了归一化更新,涵盖 Falcon-1、Falcon-2、Falcon-3 及其内积变体,同时提供递归、掩码并行和分块并行形式,以及数值稳定的正衰减重新归一化。代表性变体在语言建模中仍具竞争力,并改善了可变位数加法任务中的长度外推能力。该框架区分了时间对齐、可塑性、遗忘和有界重放。
行业资讯 AI模型 研究 2026-08-31 15:00:53 687 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。