FactorEngram:用于语言模型的基向量级门控因式分解 N 元记忆
FactorEngram 是一种面向语言模型的因式分解 N 元记忆,使用共享基向量,并根据上下文分别调节各记忆成分。与将检索到的嵌入视为不可拆分单元的设计不同,它能够选择性读取相关成分,相关模式也可以复用共同成分。在拥有 3.4 亿和 10 亿参数的 Transformer 主干模型上测试时,该方法提升了语言建模和下游任务表现。消融研究表明,在中间层的注意力子层之前插入记忆分支是一种有效配置。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。