Fathom:为卸载式 KV 缓存的稀疏解码实现按查询调整读取深度
Fathom 是一种用于加速长上下文智能体会话解码的方法,适用于 KV 缓存及其排序索引位于主机内存的场景。每个查询会决定从各个键通道读取多少位,并根据通道的重要性分配位预算。在 Qwen3-8B 的百万 token 测试中,Fathom 的单步解码速度比 Double Sparsity、Loki 和 SparQ r=32 使用的 136 位扫描快 1.67 倍。在与 SparQ 68 位读取相同的 GPU 时间下,Fathom 少读取 18% 的字节,并在七种模型与上下文设置中的六种实现了更低的注意力误差。该方法利用量化服务系统已经保存的 4 位 K 缓存副本。索引驻留在 GPU 内存时,Fathom 不会带来速度提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。