AI 新闻中心

AI 新闻中心 过去7天分析了 596 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

行业首个系统级 Agent Harness 架构:荣耀 Magic9 系列首发搭载阿里巴巴 Qwen Intelligence

阿里巴巴发布了面向 AI 手机的全栈解决方案 Qwen Intelligence。预计于 9 月 28 日发布的荣耀 Magic9 系列将成为首批正式支持该方案的机型,荣耀 Robot Phone 也将提供支持。该平台基于 Qwen 大模型,旨在更可靠地执行跨应用的复杂任务。阿里巴巴与荣耀还将基于 Qwen Intelligence 和 MagicOS,共同开发面向下一代 AI 手机的垂直领域模型

阿里巴巴发布千问 AI 眼镜 N1 系列,支持眼动追踪与虹膜支付

阿里巴巴在杭州举行的 2026 云栖大会上展示了千问 AI 眼镜 N1、N1 Pro,以及千问 AI 耳夹式耳机。三款产品已开启线上预约,预计 10 月 13 日正式发售。N1 系列搭载 5000 万像素传感器,支持第一视角拍摄。N1 Pro 进一步支持眼动追踪和虹膜支付。阿里巴巴称,用户看着展品提问时,AI 可结合视线信息判断用户所指的对象。耳夹式耳机支持面对面翻译、AI 听记和语音办事。阿里巴

澳大利亚押注人工智能,力促未来数十年经济增长

澳大利亚预计人工智能将在未来40年推动经济增长。财政部发布的《代际报告》称,AI有望帮助该国实现劳动生产率年增长1.2%的长期目标。报告还估计,到2030年,数据中心投资规模可能达到1500亿美元。澳新银行集团首席经济学家理查德·叶曾加将分析这一趋势对澳大利亚经济增长前景的影响。

阿里巴巴正在训练 Qwen4 和下一代视频模型,未来模型将扩展至 5—10 万亿参数

阿里巴巴在云栖大会上公布了千问大模型系列的最新进展。据公司介绍,基于新一代架构的 Qwen4 已进入训练阶段,未来 Qwen4.5、Qwen5 等版本将扩展至 5—10 万亿参数。阿里还宣布,下一代视频生成模型将于 11 月发布,重点提升视频时长、可控性,以及人物、场景、镜头和完整叙事的一致性。阿里称,Qwen3.8-Max 能自主搭建部分训练流程、构造数据、设计实验并定位缺陷,在没有人类直接参与

北京大学研究员评价:MiMo-V2.6-Pro 达到训练有素的博士研究人员水平

小米发布开源 MiMo-V2.6 系列,包含多模态模型 Pro 和 Flash。据小米介绍,MiMo-V2.6-Pro 在金属有机框架(MOF)材料研究中协助检索文献、提出候选方案并分析模拟结果,探索用于吸附 PFAS 的材料设计;研发周期据称从约一个月缩短至两三天。北京大学研究员窦锦虎评价其达到训练有素的博士研究人员水平。小米还称,该模型协助使用 Lean 4 完成了 Li–Yorke 经典论文

苹果零售先驱质疑消费者会把购物完全交给AI代理

苹果零售业务早期负责人罗恩·约翰逊认为,AI代理很难完全取代实体店购物体验。谷歌正通过Universal Commerce Protocol推动AI代理覆盖商品发现、比较和结账流程,OpenAI也在将ChatGPT打造为购物平台。但约翰逊表示,消费者不太可能在未亲自查看、触摸产品的情况下,让AI直接购买高价笔记本电脑。他认为,AI更适合帮助用户搜索信息、比较产品并缩小选择范围,而不是取代人的判断。

毛利率跌至-50%,硅谷初创企业转向开放模型以摆脱OpenAI依赖

估值156亿美元的法律AI独角兽Harvey,据报正因模型调用和API成本飙升而降低对OpenAI与Anthropic的依赖。AI智能体更新后,客户使用量大幅增长,但其毛利率据称从年初约50%降至6月的-50%。随后,Harvey推出了基于中国月之暗面Kimi K3的自研模型,并重构推理架构。公司表示,这些调整已使毛利率恢复为正。Abridge、Decagon、Ramp和Rogo等企业也在开发自有

Grounded Action Model:以三维定位为机器人基础

研究人员提出 Grounded Action Models(GAM),一种将物体三维定位明确融入机器人基础模型的方法。语言、点和框提示会被转换为统一的以物体为中心的表示,其中包含面向目标的视觉特征和可度量的物体几何信息,再由多流 Transformer 与机器人状态历史结合,预测动作片段。GAM 在 RoboTwin 2.0 的 50 项任务中取得 55.3% 的平均成功率,在 LIBERO-PR

VideoGen-Agent 通过学习工具调用提升视频生成能力

研究人员推出 VideoGen-Agent,这是一种通过多任务智能体强化学习训练、能够协调外部视频生成工具的多模态智能体。该系统在多轮交互中使用增强、生成和验证工具,以应对专业知识、特定身份保持、物理一致性、场景构图和事件顺序等问题。在包含600个提示的全新 VABench 基准测试中,VideoGen-Agent 将基础文本生成视频模型的得分从56.5提升至75.6。升级生成工具后,无需额外训练

Jev-Mem:由 System One 控制的高效 AI 智能体记忆架构

Jev-Mem 是一种面向长期运行 AI 智能体的记忆架构。它将快速、轻量的控制与较慢且成本更高的审慎推理分开。System One 控制器负责记忆分类和关系组织、查询路由、检索预算分配、图遍历、候选评分以及自适应停止检索。System Two 仅在需要复杂推理和答案合成时启用。在 LoCoMo 基准测试中,Jev-Mem 的 LLM-as-a-Judge 得分为 0.777,相比最强基线相对提升

像世界模型一样思考,像 VLA 一样行动:将世界模型表征蒸馏为紧凑型机器人策略

研究人员提出一种方法,在部署时无需进行高成本的未来模拟,就能将世界模型对物理场景的理解迁移到紧凑型视觉-语言-动作(VLA)策略中。训练期间,系统使用冻结的世界模型处理训练帧并缓存其特征,再将特征对齐作为额外训练目标。训练完成后移除教师模型,因此部署策略的运行成本与基线模型相同:在消费级 RTX 5090 上,每次决策耗时 32 毫秒,占用 1.86GB 内存。一个拥有 8 亿参数的学生模型在 L

龙芯发布自研通用 GPU 加速计算平台首个软件版本

龙芯发布了面向自研 LG200 通用 GPU 的龙芯加速计算平台首个软件版本。平台覆盖底层驱动、编译器、运行时环境、资源管理、BLAS 和 DNN 算子库、调试与性能分析工具,以及 LacInfer 推理引擎,支持 OpenCL 3.0、CUDA 兼容编程接口和 ONNX Runtime。用户可将 PyTorch、TensorFlow 导出的 ONNX 模型直接部署到龙芯 GPU,无需额外转换或重

HuRo:将人类视频机器人化,用于可扩展的VLA预训练

HuRo研究将人类活动视频机器人化后,能否作为视觉—语言—动作(VLA)模型预训练的可扩展监督数据。研究团队开发了一套流程,将不同来源的人类视频转换为与机器人对齐的观测数据和动作轨迹,并推断缺失的中间信号。由此构建的数据集包含约63万条机器人化片段,以及来自五个人类视频来源的1.42亿个处理帧。在四项真实世界操作任务中,增加机器人化预训练数据后,整体完成率从51.5%提升至80.3%;在空间和视觉

WorldCrafter:具备隐式3D感知记忆的一致性视频世界模型

WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实

中国活跃智能体已近500万个,AI算力市场到2030年或增长300%

据央视报道引用的报告,中国2026年活跃智能体数量已接近500万个,预计2030年增至1.97亿个,复合年均增长率达151.2%。同期,全球活跃智能体数量预计将从7940万个增至22.16亿个。报告预测,2030年全球人工智能算力市场规模将达到1.25万亿美元,中国市场将达到1501亿美元,约为2025年的4倍。上述数字属于行业预测,尚不能视为已经实现的市场规模或收入。