超越序列顺序:面向 Transformer 的语法信息位置嵌入
研究人员提出了语法信息位置嵌入(SiPE),在预训练期间将依存句法分析得到的语法信息注入 Transformer 使用的多种位置编码方案。最佳注入方式取决于模型架构。与未采用语法监督的基础模型相比,SiPE 使 SyntaxGym 性能最高提升 10.3%,同时将困惑度降低 9.0%。GLUE 得分也最高提升 8.2%,表明该方法的收益不仅限于语法泛化。在推理阶段,SiPE 只使用单一句法分析结果,而不是对多个可能的分析结果进行边缘化,从而控制了额外计算成本。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。