WorldCrafter:具备隐式3D感知记忆的一致性视频世界模型
WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实
AI 新闻中心 过去30天分析了 4627 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实
RRSI是一种自动改进基于大语言模型的智能体系统的方法,涵盖提示词、控制流程、工具、记忆和上下文管理。该方法旨在缓解过拟合问题,即系统在用于优化的任务上取得明显提升,却难以迁移到未见过的基准测试。RRSI限制每个候选方案可合并的修改数量,鼓励探索尚未尝试的改进路径,并通过批评器和剪枝器过滤特定于基准、成本过高或已失去作用的修改。在涵盖编程、智能体工作空间和工程设计的八项基准测试中,RRSI在优化数
据央视报道引用的报告,中国2026年活跃智能体数量已接近500万个,预计2030年增至1.97亿个,复合年均增长率达151.2%。同期,全球活跃智能体数量预计将从7940万个增至22.16亿个。报告预测,2030年全球人工智能算力市场规模将达到1.25万亿美元,中国市场将达到1501亿美元,约为2025年的4倍。上述数字属于行业预测,尚不能视为已经实现的市场规模或收入。
阿里巴巴集团CEO吴泳铭在2026年云栖大会上表示,面对强劲的客户AI需求,公司将大力投入AI基础设施建设。阿里云计划到2032年将其全球运营的数据中心规模扩大至超过20GW。阿里巴巴将AI模型、AI芯片和AI云视为机器智能时代的三大基础,并构建覆盖芯片、模型、模型服务和智能体应用的完整技术体系。此外,公司计划训练一款参数量达到5万亿至10万亿的AI模型。这些内容属于企业公布的长期目标,并不代表已
在阿里主办的 2026 云栖大会上,芯片子公司平头哥宣布将发布真武 V900 AI 芯片。阿里称,该芯片算力将达到真武 M890 的 3 倍,但报道标题写的是提升 2 倍,相关表述存在不一致。基于 V900 构建的单一集群可扩展至最多 50 万张芯片,用于支持前沿模型的训练和推理。平头哥还布局了数据中心 GPU、CPU、智能网卡和互联芯片。阿里正在对芯片、服务器、网络、模型和推理系统进行联合优化,
腾讯发布图像生成模型 Hy Image3.5 预览版。该模型支持文生图、图生图、最多上传 5 张参考图、多轮对话创作、多种画面比例以及最高 2K 分辨率。腾讯称,Hy Image3.5 在数百名专业设计师参与的内部盲测中,表现较 Hy Image3.0 提升 30%,与 Seedream 5.0 Pro 持平,并略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。不过
上海人工智能实验室与上海交通大学LUMIA Lab提出了下一概念预测(Next Concept Prediction,NCP),试图替代传统的逐词元预测预训练方式。其89亿参数模型NCP-ArchPreview使用Dolma-3语料库中的5.73万亿个词元训练。技术报告称,该模型仅使用51.3%的词元预算,就达到了OLMo-3-7B最终预训练损失水平,等效收敛速度提升1.95倍。团队还报告了下游任
该研究探讨视觉语言模型(VLM)能否将数字世界中的能力迁移到实体机器人控制。RoboDawn为智能体式VLM提供了一组精简的离散指令,用于平移、旋转和夹爪操作。模型以闭环方式运行:观察机器人的视觉状态,推理并执行下一步动作,再根据执行结果调整后续决策。通过少量上下文示例,模型可以同时学习接口使用方法和任务解决策略。在RoboTwin 2.0 C2R上,成功率从零样本条件下的53.2%提升至单示例条
一项可解释性研究探讨了最先进的视频扩散模型为何在具备出色视觉质量的同时,仍经常生成不符合物理规律的运动。研究发现,运动轨迹在早期去噪阶段形成,并由一组特定的注意力头驱动。分析还表明,旋转位置编码(RoPE)会导致空间注意力过度衰减,使早期候选区域过早锁定在不合理的位置,抑制相邻帧中的合理运动轨迹。研究人员提出一种轻量级架构改动,根据不同去噪步骤调整RoPE频率,从而帮助模型探索更合适的候选区域。无
面向生产环境的纯Go语言Agent框架covonaut发布v1.1.4版本。该版本引入滚动工具执行池调度,解决慢工具阻塞并行任务的问题;支持多模态内容通道,可自动分流并处理文本、图片、PDF、Notebook及视频;增强了安全隔离,将删除操作对接系统回收站以防误删,并拦截危险命令。升级过程无需改动接口代码。
Snap 更新了 Snapchat 的 Lens+ 订阅服务,新增多项生成式 AI 功能。用户可以长按聊天消息,选择流行、摇滚等音乐风格,生成原创短歌曲,并在发送前试听。更新还包括可重新处理好友 Snap 内容的 AI Remix、提供泡沫和喷漆等纹理的 AI 增强字体、用于生成图像的 Imagine Lens,以及可将照片转换为 5 秒视频的 AI Clips。由于这些功能需要消耗大量服务器算力
据两名知情员工透露,阿里巴巴已任命资深AI研究员刘大一恒负责Qwen(通义千问)大语言模型项目。此次任命发生在阿里巴巴今年早些时候经历多轮组织重组之后,进一步明确了Qwen团队的管理架构。即将举行的云栖大会官网将刘大一恒列为“Qwen大语言模型项目负责人”。他在演讲嘉宾名单中的突出位置,也反映出这一职务对阿里巴巴核心模型业务的重要性。
小米的 MiMo-V2.6-Pro 在 Artificial Analysis 的 Intelligence Index 中与 Grok 4.7(xHigh)得分相同,并超过 GLM-5.3(max)。根据这项基准测试,它成为得分最高的开放权重模型,领先于 xAI 的 Grok 4.6 和 Google 的 Gemini 3.8 Flash 等闭源模型。
阿里巴巴集团正在推出其所称的中国最强人工智能芯片。该加速器旨在与英伟达竞争,并支持公司到2032年将数据中心容量扩大至20吉瓦的计划。目前尚未公布详细技术规格或独立性能测试结果。
该研究提出了一种改进人工智能智能体的方法,用于处理仓库级软件工程任务。由于将不同任务类别混合进行强化学习,可能导致部分类别进步、其他类别退步,研究人员首先训练各类别专家模型。Refresh-Repair-Expand迭代流程结合长期智能体强化学习、利用已验证的成功轨迹进行监督微调,以及自适应任务重选。随后,基于标签路由的多教师在线策略蒸馏将这些专家整合为一个可部署模型,只保留相对于参考策略的改进方