Kandinsky 6.0 Video:用于同步生成视频与音频的基础模型
Kandinsky 6.0 Video 是一系列可生成 5 秒视频的基础模型,支持同步生成 44 kHz 音频和口型,包括唇形同步。Lite 和 Pro 版本分别拥有 30 亿和 290 亿参数,支持文生音视频和图生音视频。内置超分辨率模型可将输出提升至全高清分辨率。该系统采用双流 CrossDiT 架构,通过双向交叉注意力连接视频流与音频流。开发团队以 MIT 许可证发布代码、模型检查点和 Di
AI 新闻中心 过去24小时分析了 169 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Kandinsky 6.0 Video 是一系列可生成 5 秒视频的基础模型,支持同步生成 44 kHz 音频和口型,包括唇形同步。Lite 和 Pro 版本分别拥有 30 亿和 290 亿参数,支持文生音视频和图生音视频。内置超分辨率模型可将输出提升至全高清分辨率。该系统采用双流 CrossDiT 架构,通过双向交叉注意力连接视频流与音频流。开发团队以 MIT 许可证发布代码、模型检查点和 Di
InterMimicGen 是一个将人类与物体交互数据转化为人形机器人可执行动作的框架。系统在保留全身协调以及手部与物体关系的同时,将异构示范数据重新映射到机器人上,并在仿真环境中训练基于物理的通用跟踪策略。数据循环会生成保持任务语义的动作和环境变化,仅保留仿真执行成功的版本,并将其用于下一轮训练,从而逐步扩大动作覆盖范围。实验还展示了该方法向真实机器人的迁移能力。
许多基于 LoRA 的持续学习方法采用较小的学习率来减少遗忘,但固定设置无法阻止遗忘随着历史知识累积而加剧。该研究推导出一条根据既有知识有效秩调整梯度步幅的规则。PaLoRA结合自适应SVD截断来压缩历史知识、将梯度投影到先前任务的零空间,并根据秩调整更新节奏。实验显示,与已有方法相比,PaLoRA的表现持续提升,尤其适用于较长的任务序列。在具有挑战性的50任务ImageNet-A和ImageNe
该研究提出 ASCENT,使基于大语言模型的智能体在部署期间从已验证的任务轨迹中学习。该方法不直接模仿智能体生成的 token,而是使用模型初始状态的冻结副本,沿已验证轨迹进行事后预测,再将预测蒸馏到可持续保留的 LoRA 适配器中,以提升后续任务表现。在 ALFWorld、WebShop 和 AppWorld 上的评估显示,随着经验积累,任务成功率和交互效率均有所提高,且能力能够迁移到未见过的场