原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.08448
立即前往原文

重新思考跨分词器的在线策略蒸馏:从对齐覆盖率到监督可靠性

这项研究探讨扩大不同分词器之间的对齐范围能否改善在线策略蒸馏。在数学推理和代码生成的三组异构教师—学生模型中,严格的 1:1 token 分组已覆盖学生生成的大多数 token。仅对共享词表中概率最高的 16 个 token 进行反向 KL 监督,其准确率与使用完整共享词表相当,并优于受测基线。为不匹配的 token 片段增加监督虽实现了完整覆盖,却降低了准确率。研究结果表明,与追求最大对齐覆盖率相比,优先采用可靠的训练信号可能更有效。
行业资讯 AI模型 研究 2026-10-07 13:01:00 127 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。