原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.20958
立即前往原文

TLive-Omni:面向电商直播的全模态理解模型

TLive-Omni是一种面向电商直播的全模态理解模型,可统一处理语音、视频、商品图片、叠加文本和用户查询。其Per-vGrid方法通过带时间戳的令牌组织,将视频片段与对应音频进行时间对齐。模型采用三阶段监督训练流程,并引入Faithful-RFT强化微调,以在满足实时要求的同时提升回答的忠实度和表达质量。系统还包括面向具体场景的数据生成引擎,以及用于大规模训练的高效采样策略。实验结果显示,该模型在电商直播基准测试的多项任务上表现较强,并在通用基准测试中展现出良好的泛化能力。
行业资讯 应用 AI模型 研究 2026-08-25 10:30:57 448 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。