原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.06648
立即前往原文

面向扩散语言模型的表征空间 MMD

这项研究提出一种扩散语言模型的后训练方法,在冻结的预训练模型特征空间中,最小化生成分布与参考分布之间的最大均值差异(MMD)。保留各个 token 位置的上下文特征后,只需运行一次特征提取器,每个序列便可提供多个观测值。离散模型通过策略梯度优化目标,连续模型则通过生成的潜变量进行直接微分,因此无需完整采样轨迹,也无需联合训练辅助模型。实验显示,在 OpenWebText 上熵相近时生成困惑度更低,在 GSM8K 上准确率与计算成本的权衡有所改善。对于 16B DMax-LLaDA2.0 模型,该方法提高了解码并行度,并在数学和代码基准测试中保持相近或更高的准确率。
行业资讯 AI模型 研究 2026-10-06 15:01:07 319 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。