LatentPress:超越文本与视觉的上下文压缩
LatentPress将对话历史和长文档压缩为连续记忆标记,使冻结的语言模型能够通过输入嵌入接口直接读取,无需在推理阶段重建文本。一个与读取器匹配的小型写入器仅训练包含420万至2620万个参数的适配器,即可实现4至16倍压缩。在LongMemEval测试中,压缩7.7倍时准确率达到0.504,高于未压缩证据的0.490,也超过了基于文本摘要和OCR的压缩方法。每段对话的写入耗时约43毫秒,读取速度比原始上下文或缓存的OCR快5至9倍。实验代码已在GitHub开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。