高通展示可在手机上运行的300亿参数AI模型,预填充吞吐量超每秒330个Token
高通在2026年骁龙峰会上宣布,与阶跃、无量火及江波龙合作,基于第六代骁龙8超级至尊版移动平台,对StepEdge-Omni 30B-MoE模型进行端侧适配和推理优化。该混合专家模型仅根据任务需要激活部分专家模块,以降低计算量和内存带宽需求。合作方表示,通过优化推理引擎、异构调度和存储方案,模型运行内存需求较传统方案降低超过50%。模型无需调用云端,即可在手机上完成邮件理解、行程规划、日历同步、航班和酒店推荐以及邮件撰写等任务。测试显示,其预填充吞吐量超过每秒330个Token,解码吞吐量超过每秒28个Token。大规模应用仍取决于终端成本、功耗、模型可靠性和用户接受度。
本文来源:IT之家,仅供学习参考,版权归原作者所有。