原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.20210
立即前往原文

Daedalus-150M:为 CPU 推理设计的卷积与注意力混合模型

Daedalus-150M 并不是先训练大型模型再压缩到 CPU,而是从一开始就针对普通 CPU 推理进行设计。18 个模块中只有 6 个使用完整注意力,其余 12 个采用记忆范围固定为两个时间步的短卷积,从而减少对不断增长的缓存的重复读取。该模型使用 599 亿个 token 从头训练,在五项任务基准测试中获得 47.31 分,高于训练前预先设定的 42.20 基准。与使用相同数据训练、规模相同的全注意力模型相比,它在选定质量指标上提升 0.81%,4 位元文件小 6.3%,在 2048 个 token 的上下文下解码速度快 1.76 倍。研究同时报告了 4 位元量化带来的质量损失、部分卷积通道处于闲置状态,以及词表规模相对于模型容量过大的问题。
行业资讯 硬件 AI模型 研究 2026-08-24 15:01:18 537 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。