X-AuT:通过跨尺度蒸馏渐进式压缩语音大语言模型的音频编码器
X-AuT通过逐步移除音频编码器层,降低语音大语言模型的推理成本。由于直接删除完整模块可能破坏解码器所使用的表示,该方法结合了行为探针、表示对齐、跨尺度蒸馏、分阶段的学生策略监督和LoRA微调。语言模型骨干保持冻结。在10个公开中英双语基准测试中,将Qwen3-ASR-0.6B的音频编码器从18层压缩到16层后,宏平均错误率从5.61%降至5.27%。14层版本将音频塔参数减少20.7%,错误率达到5.75%。这些结果基于单次实验,且不同基准测试中的准确率变化并不一致。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。