Transformer 未充分利用模型深度:小型 LoRA 可延长推理链
一项研究发现,在 13 个基础模型中,预训练 Transformer 只能可靠地追踪上下文参考链中的 1.4 至 3.6 行;增加预训练循环帮助不大。在早期层加入针对任务训练的 rank-8 LoRA,并冻结其余全部模型权重后,Qwen3-8B 在 24 行链上的完全准确率从 15.5% 提升至 99%。延长 LoRA 训练可处理更长的链;Ouro-1.4B 在八次循环后达到至少 160 行。分析显示,中间层可能通过接力机制传递链的身份信息。结果仅适用于所测试的任务,不能证明模型的一般能力有所提升。研究已提供代码和交互式演示。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。