Llama-Mobile:高效的 2.7 位视觉语言模型量化
Llama-Mobile 是一个面向移动设备的视觉语言模型量化框架,旨在资源受限的硬件上实现高效推理。其量化流程利用模型自身生成训练数据,无需访问原始训练环境。新的每参数 2.7 位格式支持在 Arm CPU 上高效运行。研究人员在使用 8 位激活值的情况下,将 Llama 3.2 11B Vision Instruct 压缩至 3.7GB,并在多项标准视觉问答任务中保持了较强性能。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。