AI 新闻中心

AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

行业首个系统级 Agent Harness 架构:荣耀 Magic9 系列首发搭载阿里巴巴 Qwen Intelligence

阿里巴巴发布了面向 AI 手机的全栈解决方案 Qwen Intelligence。预计于 9 月 28 日发布的荣耀 Magic9 系列将成为首批正式支持该方案的机型,荣耀 Robot Phone 也将提供支持。该平台基于 Qwen 大模型,旨在更可靠地执行跨应用的复杂任务。阿里巴巴与荣耀还将基于 Qwen Intelligence 和 MagicOS,共同开发面向下一代 AI 手机的垂直领域模型

Harness-Zero:通过“代理即Harness”实现代理Harness蒸馏

Harness-Zero旨在将专用代理Harness带来的性能提升迁移到模型权重中。引导代理会在固定目标Harness的动作空间内纠正学生模型的回答,并据此生成微调数据。部署时可以移除专用Harness。在知识工作、工具使用和科学任务实验中,该方法将任务成功率宏平均从23.3%提升至44.3%,甚至超过保留专用Harness时的41.7%。此外,在三个领域的28种Harness诱导行为模式中,平均

阿里巴巴正在训练 Qwen4 和下一代视频模型,未来模型将扩展至 5—10 万亿参数

阿里巴巴在云栖大会上公布了千问大模型系列的最新进展。据公司介绍,基于新一代架构的 Qwen4 已进入训练阶段,未来 Qwen4.5、Qwen5 等版本将扩展至 5—10 万亿参数。阿里还宣布,下一代视频生成模型将于 11 月发布,重点提升视频时长、可控性,以及人物、场景、镜头和完整叙事的一致性。阿里称,Qwen3.8-Max 能自主搭建部分训练流程、构造数据、设计实验并定位缺陷,在没有人类直接参与

北京大学研究员评价:MiMo-V2.6-Pro 达到训练有素的博士研究人员水平

小米发布开源 MiMo-V2.6 系列,包含多模态模型 Pro 和 Flash。据小米介绍,MiMo-V2.6-Pro 在金属有机框架(MOF)材料研究中协助检索文献、提出候选方案并分析模拟结果,探索用于吸附 PFAS 的材料设计;研发周期据称从约一个月缩短至两三天。北京大学研究员窦锦虎评价其达到训练有素的博士研究人员水平。小米还称,该模型协助使用 Lean 4 完成了 Li–Yorke 经典论文

毛利率跌至-50%,硅谷初创企业转向开放模型以摆脱OpenAI依赖

估值156亿美元的法律AI独角兽Harvey,据报正因模型调用和API成本飙升而降低对OpenAI与Anthropic的依赖。AI智能体更新后,客户使用量大幅增长,但其毛利率据称从年初约50%降至6月的-50%。随后,Harvey推出了基于中国月之暗面Kimi K3的自研模型,并重构推理架构。公司表示,这些调整已使毛利率恢复为正。Abridge、Decagon、Ramp和Rogo等企业也在开发自有

Grounded Action Model:以三维定位为机器人基础

研究人员提出 Grounded Action Models(GAM),一种将物体三维定位明确融入机器人基础模型的方法。语言、点和框提示会被转换为统一的以物体为中心的表示,其中包含面向目标的视觉特征和可度量的物体几何信息,再由多流 Transformer 与机器人状态历史结合,预测动作片段。GAM 在 RoboTwin 2.0 的 50 项任务中取得 55.3% 的平均成功率,在 LIBERO-PR

VideoGen-Agent 通过学习工具调用提升视频生成能力

研究人员推出 VideoGen-Agent,这是一种通过多任务智能体强化学习训练、能够协调外部视频生成工具的多模态智能体。该系统在多轮交互中使用增强、生成和验证工具,以应对专业知识、特定身份保持、物理一致性、场景构图和事件顺序等问题。在包含600个提示的全新 VABench 基准测试中,VideoGen-Agent 将基础文本生成视频模型的得分从56.5提升至75.6。升级生成工具后,无需额外训练

GameHorizon Suite推出面向多时间尺度游戏智能的数据集与评测基准

GameHorizon Suite是一套用于评估电子游戏中AI模型能力的数据集和基准。它衡量视觉理解、指令分解、目标规划,以及跨越短期和长期时间尺度的精确动作控制。该套件包括自动化标注流程、由100名资深玩家在21款AAA游戏中收集的5,000小时游戏记录,以及在时间上对齐的视频、玩家动作和多时间尺度指令。基准同时支持可复现的离线测试和逐步在线评估。研究团队对47个模型进行了超过100万次模型调用

像世界模型一样思考,像 VLA 一样行动:将世界模型表征蒸馏为紧凑型机器人策略

研究人员提出一种方法,在部署时无需进行高成本的未来模拟,就能将世界模型对物理场景的理解迁移到紧凑型视觉-语言-动作(VLA)策略中。训练期间,系统使用冻结的世界模型处理训练帧并缓存其特征,再将特征对齐作为额外训练目标。训练完成后移除教师模型,因此部署策略的运行成本与基线模型相同:在消费级 RTX 5090 上,每次决策耗时 32 毫秒,占用 1.86GB 内存。一个拥有 8 亿参数的学生模型在 L

HuRo:将人类视频机器人化,用于可扩展的VLA预训练

HuRo研究将人类活动视频机器人化后,能否作为视觉—语言—动作(VLA)模型预训练的可扩展监督数据。研究团队开发了一套流程,将不同来源的人类视频转换为与机器人对齐的观测数据和动作轨迹,并推断缺失的中间信号。由此构建的数据集包含约63万条机器人化片段,以及来自五个人类视频来源的1.42亿个处理帧。在四项真实世界操作任务中,增加机器人化预训练数据后,整体完成率从51.5%提升至80.3%;在空间和视觉

WorldCrafter:具备隐式3D感知记忆的一致性视频世界模型

WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实

阿里巴巴目标到2032年全球数据中心规模超过20GW

阿里巴巴集团CEO吴泳铭在2026年云栖大会上表示,面对强劲的客户AI需求,公司将大力投入AI基础设施建设。阿里云计划到2032年将其全球运营的数据中心规模扩大至超过20GW。阿里巴巴将AI模型、AI芯片和AI云视为机器智能时代的三大基础,并构建覆盖芯片、模型、模型服务和智能体应用的完整技术体系。此外,公司计划训练一款参数量达到5万亿至10万亿的AI模型。这些内容属于企业公布的长期目标,并不代表已

腾讯发布 Hy Image3.5 预览版,支持文生图与多轮对话创作

腾讯发布图像生成模型 Hy Image3.5 预览版。该模型支持文生图、图生图、最多上传 5 张参考图、多轮对话创作、多种画面比例以及最高 2K 分辨率。腾讯称,Hy Image3.5 在数百名专业设计师参与的内部盲测中,表现较 Hy Image3.0 提升 30%,与 Seedream 5.0 Pro 持平,并略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。不过

上海AI实验室与上海交大提出NCP预训练范式,发布89亿参数隐空间模型

上海人工智能实验室与上海交通大学LUMIA Lab提出了下一概念预测(Next Concept Prediction,NCP),试图替代传统的逐词元预测预训练方式。其89亿参数模型NCP-ArchPreview使用Dolma-3语料库中的5.73万亿个词元训练。技术报告称,该模型仅使用51.3%的词元预算,就达到了OLMo-3-7B最终预训练损失水平,等效收敛速度提升1.95倍。团队还报告了下游任