原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.05076
立即前往原文

自生成反馈会使测试时训练失稳:长程适应的因果分解

一项研究分析了测试时训练(TTT),即模型在推理过程中将信息存储到自身权重中。当模型使用自己生成的文本进行学习时,在最长达12.8万令牌的文本流上,其对独立的人类书写文本的预测性能会下降。该现象在三种 TTT-E2E 配置以及更新 Qwen3-4B 现有权重时均会出现。受控对比表明,让冻结的模型生成训练片段,可在较小配置中消除超过98%的损害。更新虽然提升了模型对来源文本的预测,却会损害其对新真实文本的表现。在提交更新前,先用独立证据评估候选状态,可以大幅缩小最终性能差距,同时保留对真实文本的适应能力。
行业资讯 AI模型 研究 2026-10-06 17:01:11 472 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。