从3.3GB压缩至440MB:腾讯混元极低比特量化基本保持翻译质量
腾讯混元团队将旗下18亿参数的端侧翻译模型Hy-MT2大幅压缩。2-bit版本大小为574MB,1.25-bit版本则将原本3.3GB的模型压缩至440MB。方案结合了弹性量化、量化感知蒸馏,以及腾讯自研的Sherry稀疏三值量化技术。英特尔针对包括最新酷睿Ultra在内的x86处理器,对低比特矩阵运算进行了适配和优化。哔哩哔哩已将该压缩模型用于直播弹幕实时翻译。完整下载资源约600MB,运行时内存占用约为500至700MB,单条弹幕平均翻译耗时约500至800毫秒。模型支持33种语言互译,并可在设备本地处理数据,从而降低云端推理和带宽成本,减少数据上传需求。
本文来源:AIbase,仅供学习参考,版权归原作者所有。