原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.09444
立即前往原文

通过连续深度批处理实现循环语言模型的深度自适应推理

循环语言模型可根据 token 的难度调整其经过共享层的次数,但不同的循环次数会使高效批处理变得困难。Continuous Depth Batching(CDB)方法在循环步骤之间动态构建新批次、管理 KV 缓存,并预测哪些 token 将退出循环。对 Ouro 1.4B 和 Huginn 3.5B 的实验表明,完全循环式架构最适合这一方法。CDB 达到了估算最大加速幅度的最高 99%;进一步提升主要取决于模型架构和退出行为。
行业资讯 AI模型 研究 2026-09-28 19:01:06 562 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。