Periscope扩展冻结语言模型,突破上下文窗口限制
Periscope是一种无需训练的推理方法,可让冻结的语言模型处理超长文档,而无需一次性将全文载入上下文缓存。该方法将文档切分为多个区块,同时评估局部片段和覆盖全文的跨步片段,并据此生成证据图,找出最可能支持答案的区块。在LongBench v2中,仅阅读排名最高的9,000个token,就达到了同一模型在3.2万至100万个token上下文中采用窗口读取时的最佳表现。在InfiniteBench中,该方法比最佳窗口读取方法高出5分。借助Periscope,27B模型可在单张80GB GPU上处理450万token的上下文,而一次完整读取则需要296GB缓存。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。