从1.5TB压缩至214GB:腾讯开源混元Hy4 Preview轻量版
腾讯混元团队发布了Hy4 Preview轻量版。这款混合专家(MoE)语言模型总参数量达7700亿,通过Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略,将模型权重从接近1.5TB压缩至约214GB。在长文理解等主要任务上,轻量版整体保持稳定表现;MCP Atlas得分从83.7降至83.2,SWE-Bench Multi从82.9降至81.3。腾讯与prima.cpp的测试显示,使用一台搭载单张RTX 4090的笔记本和一台配备四张A4000的服务器进行异构推理,可达到每秒1.02个token,约为笔记本单机offload速度的6倍。该模型已在Hugging Face和GitHub上线,支持llama.cpp、vLLM、SGLang等推理框架。
本文来源:IT之家,仅供学习参考,版权归原作者所有。