以镜头为单位思考:通过智能体推理实现一致的多镜头视频编辑
生成式人工智能推动了视频编辑技术的发展,但按照多项指令编辑长视频仍然十分困难。按固定时长切分视频可能导致人物和物体被割裂、产生编辑幻觉,并破坏时间连续性。该研究提出多指令多镜头长视频编辑(MMLVE)任务以及 MMLVE-Bench 数据集。其智能体框架结合大语言模型和视觉语言模型,在镜头级别拆分视频,并更准确地解析编辑指令。研究还提出三项指标,用于评估跨镜头一致性、多指令解耦以及时空结构的保持程
AI 新闻中心 过去一年分析了 1378 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
生成式人工智能推动了视频编辑技术的发展,但按照多项指令编辑长视频仍然十分困难。按固定时长切分视频可能导致人物和物体被割裂、产生编辑幻觉,并破坏时间连续性。该研究提出多指令多镜头长视频编辑(MMLVE)任务以及 MMLVE-Bench 数据集。其智能体框架结合大语言模型和视觉语言模型,在镜头级别拆分视频,并更准确地解析编辑指令。研究还提出三项指标,用于评估跨镜头一致性、多指令解耦以及时空结构的保持程
GameWAM是一种用于电子游戏和图形用户界面原生闭环交互的世界-动作模型。它能够同时生成未来的视觉观测以及可执行的键盘和鼠标操作轨迹。该系统区分游戏操作与GUI操作模式,通过只执行短动作前缀、再依据新观测重新规划来处理长时程交互,并使用同步的游戏和GUI轨迹进行训练。实验表明,GameWAM在任务成功率方面具有竞争力,同时执行的原生操作少于对比智能体。研究还发现一种失败模式:在条件固定时,生成动
腾讯发布了开源模型 Hy4 preview,总参数量 7700 亿,激活参数 490 亿,上下文长度达到 100 万 Token。腾讯称,该模型在软件工程、办公分析、游戏开发和科学研究等任务上有所提升。在由 163 名内部专家对 203 项工程任务进行的盲测中,Hy4 preview 平均得分为 2.99 分(满分 4 分),略高于腾讯公布的 GLM-5.3 和 Kimi K3 得分。腾讯还表示,
论文提出 Self-OPD,一种面向流匹配模型的无教师策略内蒸馏框架。现有 OPD 方法通常需要为每个新目标训练专门的预训练教师模型,计算成本较高;教师与学生分布之间的差异还可能导致生成轨迹中的误差累积。Self-OPD 将学生模型自身的探索转化为逐步监督信号。在每个时间步,方法从确定性的下一状态预测中生成多个随机候选,通过采样运行这些候选,并将其奖励与模型自身的确定性参考基线进行比较。优势较高的
PILOT 是一种监督者—工作者框架,支持 AI 智能体在执行过程中持续改进。独立的监督者可以在工作者运行期间重新引导或终止任务,同时将执行过程中发现的流程和失败模式提炼为可复用的技能与记忆。在两个冻结的基础模型和三个基准测试中,PILOT 在六种配置中的五种排名第一。在 Terminal-Bench 2.0 上,其表现最多领先对比框架 9.8 个百分点。在自我改进测试中,使用 GLM-5.1 和
TTPO是一种无需真实标签、在推理阶段训练大语言模型的方法。它利用多数投票生成伪标签,对与投票结果一致的输出进行蒸馏,并惩罚不一致输出中的高置信度错误,以降低错误伪标签误导整个更新过程的风险。在五项竞赛级基准测试中,TTPO达到了使用标签监督的在策略自蒸馏方法的水平。在Qwen3-1.7B上,测试时训练性能从38.0%提升至45.2%;在不进行扩展思考的情况下,研究还报告了25.2%至36.4%的
PAWBench提出将概率对齐作为评估世界模型的标准。模型不仅要生成一条合理的轨迹,还应在相同的初始观测和行动条件下,正确复现各种可能结果的分布。该基准及PAWEval评测协议在50个场景和11个现有系统上分析了重复视频生成结果。没有任何受测模型能够持续匹配参考概率,同时覆盖全部有效的物理行为。研究还考察了语言提示、初始噪声和模型训练是否能够改变模型的预测分布。
Zero-WAM是一种因果视频—动作模型,使机器人能够依据人类视频示范执行训练中未见过的操作任务。研究人员构建了HumanGen数据集,通过自动化流程生成涵盖8600项任务的74200组人类—机器人上下文学习配对。在RoboTwin 2.0模拟环境中,Zero-WAM在7项未见任务上取得47.0%的平均成功率,比最强的视频—动作基线高29.5个百分点。真实世界测试涵盖多物体场景、长时序操作以及精细
该研究提出 UrbanGround,这是一个用于评估多模态大语言模型代理在复杂城市环境中表现的测试平台。研究团队利用覆盖香港全域的三维地理空间数据,构建了一个具有物理约束的香港城市复制环境,使代理能够以第一人称视角探索城市,并通过交互式地图进行导航。研究考察局部视觉感知能否支持空间问题回答、远距离导航,以及对路线和行人运动变化的适应。当前的多模态大语言模型代理在视觉识别和短距离空间推理方面表现出一
中国国光量超人工智能研究团队宣布,将量子技术引入大语言模型的核心决策与推理流程,并推出面向科研和学术领域的“玄幂”模型系列。团队称,该模型在科研科普、任务路由和智能体决策等特定任务中,相较主流开源模型具有更深入的专业理解、更清晰的任务判断和更短的决策路径。此次公告未提供独立技术验证或基准测试结果。
该研究分析了进化策略(ES)作为一种面向大语言模型推理能力的内存高效后训练方法。与群组相对策略优化(GRPO)相比,ES能够保持更高的候选解多样性,并在Pass@K指标上取得更好表现。GRPO容易出现熵坍缩,而ES在提升Pass@1的同时,可以覆盖更多推理路径。研究提出的序列式GRPO-ES训练策略,结合了GRPO获取最佳答案的优势与ES更广泛的覆盖能力。研究还发现,尽管模型整体参数可能发生较大漂
该研究提出了一个用于生成和评估 LLM 智能体交互数据的两层框架。研究将智能体数据表示为环境、任务、交互以及可选验证器的组合,并通过 ACE 视角——准确性、复杂性和多样性——分析如何生成有环境依据、内部一致、符合特定学习者能力且不重复的经验数据。文献显示,相关研究正逐步转向基于执行结果的准确性、相对于学习者的复杂性,以及超越表面变化的数据多样性。研究指出,核心挑战并非简单增加数据量,而是在智能体
VGI-Bench 是一个用于评估视频生成模型视觉推理能力的基准测试,包含 27 项任务和 810 个实例,并按任务领域和技能标签进行分类。评估结果显示,当前生成系统能够解决部分基于视觉的推理任务,但整体可靠性仍然不足。即使是表现最强的模型 Seedance 2.0,按照该研究的评估标准也只达到 51.0%。研究还分析了输出失败模式、对输入条件的敏感性、合成数据微调带来的性能迁移边界,以及去噪过程
一种新的机器学习框架旨在提高计算蛋白质设计的成功率,同时推动设计结果摆脱对自然界已有蛋白质序列的重复。
Prefix Sliding 研究提出了一种降低语言模型长时间推理内存成本的方法。模型不再通过完整注意力机制保留全部推理轨迹,而是仅保留包含关键指令和工具信息的前缀,以及最近几千个词元组成的窗口。这样,无论推理持续多久,内存需求都能保持在固定上限内。研究人员称,在无需额外训练的情况下,该方法可让现有模型提速最多三倍,同时保持性能。结合强化学习后,模型还能处理超过十万个词元的推理轨迹,并取得更好表现