原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.18063
立即前往原文

内存墙的另一半:通过训练式路由预测从 SSD 运行 35B MoE

Edge0 是一款流式推理引擎,旨在让混合专家模型在消费级硬件上运行。经过训练的预路由器会提前一个 token 预测下一层将选择的专家,使所需权重能够从 SSD 预先读取,并与计算过程重叠。未合并的恢复 LoRA 用于弥补 int4 量化和替换原有路由造成的质量损失。在一台配备 24GB 内存的机器上,Edge0 可让 35B MoE 模型以每秒 20 个 token 的速度运行,峰值活动内存仅为 3GiB。在五项公开基准测试中,其平均表现与 FP16 教师模型相差仅几个百分点。该框架、检查点和适配器均已开源。
行业资讯 应用 硬件 AI模型 研究 开源 2026-09-17 19:01:01 424 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。