原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.16157
立即前往原文

FreeToken:面向边缘设备的高效带宽自适应 MoE 推理系统

FreeToken 是一套面向边缘设备的推理系统,旨在让个人电脑运行混合专家(MoE)模型。系统围绕本地 AI 的硬件差异和代理任务动态变化,协同优化模型布局与加载、专家驻留、CPU-GPU 执行、代理状态复用以及运行时内存管理。FreeToken 支持 20 多个 MoE 模型,以及编程和工具调用代理,适用于从配备 8GB GPU 的笔记本电脑到单 GPU 工作站的多种设备。开发团队称,该系统可在笔记本上运行 35B 模型,在游戏台式机上运行 284B 模型,并在单个工作站 GPU 上运行 753B 的 GLM-5.2。系统已通过 flashml.ai 发布。
行业资讯 应用 硬件 行业新闻 研究 2026-08-19 12:00:57 189 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。