原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.17652
立即前往原文

Fathom:为卸载式 KV 缓存的稀疏解码实现按查询调整读取深度

Fathom 是一种用于加速长上下文智能体会话解码的方法,适用于 KV 缓存及其排序索引位于主机内存的场景。每个查询会决定从各个键通道读取多少位,并根据通道的重要性分配位预算。在 Qwen3-8B 的百万 token 测试中,Fathom 的单步解码速度比 Double Sparsity、Loki 和 SparQ r=32 使用的 136 位扫描快 1.67 倍。在与 SparQ 68 位读取相同的 GPU 时间下,Fathom 少读取 18% 的字节,并在七种模型与上下文设置中的六种实现了更低的注意力误差。该方法利用量化服务系统已经保存的 4 位 K 缓存副本。索引驻留在 GPU 内存时,Fathom 不会带来速度提升。
行业资讯 硬件 AI模型 研究 2026-09-17 19:30:55 180 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。