内存墙的另一半:通过训练式路由预测从 SSD 运行 35B MoE
Edge0 是一款流式推理引擎,旨在让混合专家模型在消费级硬件上运行。经过训练的预路由器会提前一个 token 预测下一层将选择的专家,使所需权重能够从 SSD 预先读取,并与计算过程重叠。未合并的恢复 LoRA 用于弥补 int4 量化和替换原有路由造成的质量损失。在一台配备 24GB 内存的机器上,Edge0 可让 35B MoE 模型以每秒 20 个 token 的速度运行,峰值活动内存仅为 3GiB。在五项公开基准测试中,其平均表现与 FP16 教师模型相差仅几个百分点。该框架、检查点和适配器均已开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。