迈向十亿级容量用户表示学习的“Densing定律”
一项研究分析了在十亿级数据规模下,用户表示学习应如何扩展分词配置。基于支付宝数据集的实验表明,单纯增加原始用户行为数据会带来递减的性能收益,而分词仍能持续提升效果。研究发现,最低必要分词容量与输入数据规模的对数之间大致呈线性关系。研究团队据此提出ALGN,一种自适应可变长度分词方法,可改善容量分配,并在多种数据来源、分词方法和下游任务中优于现有基线方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。