MemoryAthena:在潜在记忆与生成记忆之间进行自适应路由
MemoryAthena研究有用的模型记忆能否通过生成获得,而不只是检索。该方法结合从Engram表直接检索和两种生成路径,并学习何时让生成结果补充直接检索。训练时,骨干模型和记忆组件保持冻结,仅训练轻量级路由头。与直接检索相比,五项问答任务的平均分从37.65提升至39.28;六项通用自然语言处理任务的平均分从76.73提升至79.13。结果显示选择性路由具有潜力,但生成记忆会因上下文不同而补充或干扰检索。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。