滑动窗口注意力优于线性注意力
一项研究比较了经过后训练的线性注意力模型与滑动窗口注意力(SWA),发现SWA在多个大语言模型和下游任务上的表现相当或更好。在长上下文推理测试中,SWA的性能比线性注意力高出2至10倍。SWA无需额外后训练,运行速度快,并能降低推理时的内存占用。研究人员因此建议使用SWA替代经过后训练改造的线性注意力模型,认为它成本更低且可靠性更高。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。