原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.02367
立即前往原文

缺失的时间连接:用于脚本驱动音视频生成的Temporal Context Routing

音视频联合生成模型在画面质量和音画同步方面取得了明显进展,但对镜头切换和对白出现时间的控制仍然有限。Temporal Context Routing(TCR)将结构化脚本中的时间信息映射到音频与视频共享的时间轴上,并把提示词引导传递到两种模态中的对应位置。在200个测试脚本上,TCR将镜头边界平均绝对误差降低了96%,从1.11秒降至0.042秒;0.5秒内对白准确率则从28.3%提升至84.1%。该方法在保持与基线相当的画面质量和音画同步性的同时,用户研究显示参与者在评估的五个维度上都更偏好TCR。
行业资讯 应用 AI模型 研究 2026-09-04 14:30:58 461 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。