AI 新闻中心

AI 新闻中心 过去一年分析了 7989 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

像世界模型一样思考,像 VLA 一样行动:将世界模型表征蒸馏为紧凑型机器人策略

研究人员提出一种方法,在部署时无需进行高成本的未来模拟,就能将世界模型对物理场景的理解迁移到紧凑型视觉-语言-动作(VLA)策略中。训练期间,系统使用冻结的世界模型处理训练帧并缓存其特征,再将特征对齐作为额外训练目标。训练完成后移除教师模型,因此部署策略的运行成本与基线模型相同:在消费级 RTX 5090 上,每次决策耗时 32 毫秒,占用 1.86GB 内存。一个拥有 8 亿参数的学生模型在 L

龙芯发布自研通用 GPU 加速计算平台首个软件版本

龙芯发布了面向自研 LG200 通用 GPU 的龙芯加速计算平台首个软件版本。平台覆盖底层驱动、编译器、运行时环境、资源管理、BLAS 和 DNN 算子库、调试与性能分析工具,以及 LacInfer 推理引擎,支持 OpenCL 3.0、CUDA 兼容编程接口和 ONNX Runtime。用户可将 PyTorch、TensorFlow 导出的 ONNX 模型直接部署到龙芯 GPU,无需额外转换或重

HuRo:将人类视频机器人化,用于可扩展的VLA预训练

HuRo研究将人类活动视频机器人化后,能否作为视觉—语言—动作(VLA)模型预训练的可扩展监督数据。研究团队开发了一套流程,将不同来源的人类视频转换为与机器人对齐的观测数据和动作轨迹,并推断缺失的中间信号。由此构建的数据集包含约63万条机器人化片段,以及来自五个人类视频来源的1.42亿个处理帧。在四项真实世界操作任务中,增加机器人化预训练数据后,整体完成率从51.5%提升至80.3%;在空间和视觉

WorldCrafter:具备隐式3D感知记忆的一致性视频世界模型

WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实

RRSI:智能体框架的正则化递归自我改进

RRSI是一种自动改进基于大语言模型的智能体系统的方法,涵盖提示词、控制流程、工具、记忆和上下文管理。该方法旨在缓解过拟合问题,即系统在用于优化的任务上取得明显提升,却难以迁移到未见过的基准测试。RRSI限制每个候选方案可合并的修改数量,鼓励探索尚未尝试的改进路径,并通过批评器和剪枝器过滤特定于基准、成本过高或已失去作用的修改。在涵盖编程、智能体工作空间和工程设计的八项基准测试中,RRSI在优化数

中国活跃智能体已近500万个,AI算力市场到2030年或增长300%

据央视报道引用的报告,中国2026年活跃智能体数量已接近500万个,预计2030年增至1.97亿个,复合年均增长率达151.2%。同期,全球活跃智能体数量预计将从7940万个增至22.16亿个。报告预测,2030年全球人工智能算力市场规模将达到1.25万亿美元,中国市场将达到1501亿美元,约为2025年的4倍。上述数字属于行业预测,尚不能视为已经实现的市场规模或收入。

阿里巴巴目标到2032年全球数据中心规模超过20GW

阿里巴巴集团CEO吴泳铭在2026年云栖大会上表示,面对强劲的客户AI需求,公司将大力投入AI基础设施建设。阿里云计划到2032年将其全球运营的数据中心规模扩大至超过20GW。阿里巴巴将AI模型、AI芯片和AI云视为机器智能时代的三大基础,并构建覆盖芯片、模型、模型服务和智能体应用的完整技术体系。此外,公司计划训练一款参数量达到5万亿至10万亿的AI模型。这些内容属于企业公布的长期目标,并不代表已

阿里平头哥将发布真武 V900 AI 芯片,算力据称提升至 M890 的 3 倍

在阿里主办的 2026 云栖大会上,芯片子公司平头哥宣布将发布真武 V900 AI 芯片。阿里称,该芯片算力将达到真武 M890 的 3 倍,但报道标题写的是提升 2 倍,相关表述存在不一致。基于 V900 构建的单一集群可扩展至最多 50 万张芯片,用于支持前沿模型的训练和推理。平头哥还布局了数据中心 GPU、CPU、智能网卡和互联芯片。阿里正在对芯片、服务器、网络、模型和推理系统进行联合优化,

腾讯发布 Hy Image3.5 预览版,支持文生图与多轮对话创作

腾讯发布图像生成模型 Hy Image3.5 预览版。该模型支持文生图、图生图、最多上传 5 张参考图、多轮对话创作、多种画面比例以及最高 2K 分辨率。腾讯称,Hy Image3.5 在数百名专业设计师参与的内部盲测中,表现较 Hy Image3.0 提升 30%,与 Seedream 5.0 Pro 持平,并略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。不过

上海AI实验室与上海交大提出NCP预训练范式,发布89亿参数隐空间模型

上海人工智能实验室与上海交通大学LUMIA Lab提出了下一概念预测(Next Concept Prediction,NCP),试图替代传统的逐词元预测预训练方式。其89亿参数模型NCP-ArchPreview使用Dolma-3语料库中的5.73万亿个词元训练。技术报告称,该模型仅使用51.3%的词元预算,就达到了OLMo-3-7B最终预训练损失水平,等效收敛速度提升1.95倍。团队还报告了下游任

将视觉语言模型的智能迁移到机器人控制

该研究探讨视觉语言模型(VLM)能否将数字世界中的能力迁移到实体机器人控制。RoboDawn为智能体式VLM提供了一组精简的离散指令,用于平移、旋转和夹爪操作。模型以闭环方式运行:观察机器人的视觉状态,推理并执行下一步动作,再根据执行结果调整后续决策。通过少量上下文示例,模型可以同时学习接口使用方法和任务解决策略。在RoboTwin 2.0 C2R上,成功率从零样本条件下的53.2%提升至单示例条

视频扩散模型为何违反物理规律?研究揭示注意力机制缺陷

一项可解释性研究探讨了最先进的视频扩散模型为何在具备出色视觉质量的同时,仍经常生成不符合物理规律的运动。研究发现,运动轨迹在早期去噪阶段形成,并由一组特定的注意力头驱动。分析还表明,旋转位置编码(RoPE)会导致空间注意力过度衰减,使早期候选区域过早锁定在不合理的位置,抑制相邻帧中的合理运动轨迹。研究人员提出一种轻量级架构改动,根据不同去噪步骤调整RoPE频率,从而帮助模型探索更合适的候选区域。无

纯Go语言Agent框架covonaut v1.1.4发布:引入滚动并行调度与多模态读取

面向生产环境的纯Go语言Agent框架covonaut发布v1.1.4版本。该版本引入滚动工具执行池调度,解决慢工具阻塞并行任务的问题;支持多模态内容通道,可自动分流并处理文本、图片、PDF、Notebook及视频;增强了安全隔离,将删除操作对接系统回收站以防误删,并拦截危险命令。升级过程无需改动接口代码。