原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.02831
立即前往原文

AudioRubrics 通过演进式奖励训练音频推理

AudioRubrics 是一个用于提升音频推理能力的强化学习框架。它从每个原始波形中生成基于音频证据的评估规则,并根据模型自身的输出持续重新生成和调整规则权重。与只监督最终答案或依赖固定人工标准的方法相比,这种设计能够针对模型当前的弱点提供自适应的训练信号。该方法旨在处理从感知到多步推理等不同类型的问题。研究人员在三个音频推理基准上进行评估,报告称其显著优于多种开源和基于训练的基线方法。分析还显示,模型的推理长度趋于稳定,且音频感知能力得到改善,表明基于声学证据的监督可能有助于提升推理质量。
行业资讯 AI模型 研究 2026-08-10 13:00:57 875 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。