仅统计样本数量还不够:候选生成策略决定大语言模型推理时扩展的能耗与性能
一项研究表明,在大语言模型的推理时扩展中,生成多个候选答案的方式会影响系统成本与性能。在候选总数固定为8个时,A100 GPU执行8次串行调用,其总GPU设备能耗是一次批量生成8个候选答案的4.64至4.86倍,P95延迟则高出5.77至6.12倍。研究指出,评估不应只报告候选数量和准确率,还应披露生成调度方式及GPU级系统指标。当显存足够且候选答案相互独立时,通过更少的调用处理更大的批次通常更高效。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。