原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.03796
立即前往原文

利用离线 Top-K Logits 和融合分块 KL 损失提高 LLM 知识蒸馏效率

一项实践研究提出了两种提高大语言模型知识蒸馏效率的系统技术。首先,预先缓存教师模型的 Top-K logits,可在不将教师模型保留于 GPU 内存中的情况下进行训练,同时保持与在线蒸馏几乎相同的训练损失。在单张 H200 GPU 上,每次迭代速度提升约 29%,吞吐量最高提升 41%。其次,融合式分块 KL 损失避免生成覆盖完整词表的 logits 张量,从而降低峰值内存使用,并支持在单张 GPU 上训练最长 32,768 个 token 的上下文。额外基准测试还评估了最高 256K token 下的内存和迭代速率扩展性。相关实现已开源。
行业资讯 AI模型 研究 开源 2026-08-10 19:00:59 760 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。