原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.19499
立即前往原文

仅统计样本数量还不够:候选生成策略决定大语言模型推理时扩展的能耗与性能

一项研究表明,在大语言模型的推理时扩展中,生成多个候选答案的方式会影响系统成本与性能。在候选总数固定为8个时,A100 GPU执行8次串行调用,其总GPU设备能耗是一​​次批量生成8个候选答案的4.64至4.86倍,P95延迟则高出5.77至6.12倍。研究指出,评估不应只报告候选数量和准确率,还应披露生成调度方式及GPU级系统指标。当显存足够且候选答案相互独立时,通过更少的调用处理更大的批次通常更高效。
行业资讯 硬件 AI模型 研究 2026-09-19 16:30:56 130 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。