原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.26333
立即前往原文

分离式量化:针对 LLM 的 Prefill 与 Decode 分别优化

Prefill 和 Decode 适合不同的量化策略:低精度运算可加快提示词处理,紧凑权重则能减少生成过程中的内存流量。研究提出分离式量化(DQ),针对两个阶段分别调整计算格式、权重和存储位置。在 Qwen 3 和 Gemma 3 上,Decode 阶段不量化激活值,可在不增加推理成本的情况下提升偏重 Decode 的任务准确率。单独训练的 Prefill 专用权重能够加快提示词处理;在 2 至 3 位元 Decode 下,其准确率可媲美或超过仅量化权重的推理方式。以 Qwen3.8-27B 为例,NVFP4 Prefiller 在不修改 Decode 检查点的前提下,使 1 位元设置在 MMLU-Pro 上提升 32.5 分,在 MMMU-Pro 上提升 35.3 分。ODP 从 SSD 读取额外的 Prefill 权重;在 llama.cpp 中,提示词长度为 8K 时,其首个 token 延迟表现比仅量化权重的基线快 1.78 倍。
行业资讯 应用 AI模型 研究 开源 2026-09-29 03:02:34 233 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。