原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.11412
立即前往原文

X-AuT:通过跨尺度蒸馏渐进式压缩语音大语言模型的音频编码器

X-AuT通过逐步移除音频编码器层,降低语音大语言模型的推理成本。由于直接删除完整模块可能破坏解码器所使用的表示,该方法结合了行为探针、表示对齐、跨尺度蒸馏、分阶段的学生策略监督和LoRA微调。语言模型骨干保持冻结。在10个公开中英双语基准测试中,将Qwen3-ASR-0.6B的音频编码器从18层压缩到16层后,宏平均错误率从5.61%降至5.27%。14层版本将音频塔参数减少20.7%,错误率达到5.75%。这些结果基于单次实验,且不同基准测试中的准确率变化并不一致。
行业资讯 AI模型 研究 2026-09-11 15:00:58 558 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。