AI 新闻中心

AI 新闻中心 过去30天分析了 2026 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

豆包输入法 iOS 版 1.5.0 新增账号登录与词库定时云端同步

豆包输入法 iOS 版已更新至 1.5.0。此次更新新增账号登录和词库定时云端同步功能,用户更换设备后也能保留数据;同时修复了语音输入跳转异常问题。该输入法使用与豆包相同的语音大模型,支持多种方言、英语以及中英混合语音输入,并提供九键、全键、双拼和手写输入。其他功能包括自动纠错、文字与标点联想、表情符号、公式和日期建议,以及剪贴板和常用语工具。

DreamX-Phi 1.0:用于机器人操作的动作条件视频世界模型

DreamX-Phi 1.0是一种面向机器人操作的视频世界模型,可根据观测帧、语言指令以及由末端执行器位姿和夹爪状态组成的动作序列,预测未来观测结果。模型通过将SE(3)几何变换注入注意力机制,保留各机械臂的身份和指定运动轨迹。轻量级深度分支用于增强场景几何建模,SAM3掩码与冻结的V-JEPA教师模型则帮助维持抓取过程中小型操作物体的一致性。此外,研究人员将多步生成器蒸馏为少步模型,以提高部署效

荣耀与抖音成立基础体验联合实验室,聚焦用户体验与 AI 创新

荣耀与抖音正式成立基础体验联合实验室,围绕用户基础体验、智慧互联和 AI 创新等领域展开合作。目前,双方尚未公布具体合作内容。此前,抖音 App 已接入荣耀 MagicOS 的任意门服务,支持图搜答疑和快速观看视频等功能。MagicOS 10 的 8 月更新还让 YOYO 记忆支持解析抖音长视频。

消息称谷歌 DeepMind 将放弃前沿模型研发,或面临大规模裁员

据媒体报道,谷歌 DeepMind 可能缩减前沿 AI 模型研发,转而聚焦成本效益更高的 Flash 级模型。此次重组或导致三分之一甚至更多员工被裁撤。知情人士称,冗余岗位、Gemini 团队在开发重点和资源分配上的分歧、算力资源紧张,以及下一代旗舰 Gemini 模型延期,都是重组的背景因素。谷歌尚未全面证实相关说法。DeepMind 首席执行官 Demis Hassabis 据称将不再负责日常

中国在武汉启动人形机器人试验方法国家标准制定

中国在武汉启动《人形机器人试验方法》系列国家标准编制工作,总则、环境感知、决策规划、运动控制等7项标准同步启动。宇树科技、小米机器人、中兴通讯等企业,以及多所高校的200多名代表参会。湖北省还成立了人形机器人与具身智能标准工作组。由于目前各家企业采用的技术标准和测试方法不一,相关标准旨在统一人形机器人的检测流程和达标判定依据,为规模化复制和产业化提供基础。官方信息显示,今年上半年中国研发的四足机器

Alaya-EVOKE:从线性扩展监督到无尽世界

Evoke 是一种交互式世界模型,旨在兼顾持久记忆、快速响应和长时生成。它将场景几何信息存储在外部的相机索引世界状态库中,只检索与当前视角相关的信息,从而使去噪器上下文不会随着会话长度增长。教师模型结合分块分组、远距离帧选择性检索和线性注意力全局状态,在内存和计算量线性增长的情况下提供长时监督。通过自强制 rollout 训练的 30 秒分布匹配目标,将这些能力迁移到三步学生模型中,在保留提示词和

AutoDesign:面向长程智能体设计的元级Harness优化

AutoDesign是一种框架,通过元级Harness优化器利用执行反馈,引导代码智能体反复改进自身的Harness。研究团队以学术论文生成海报为任务,使用新基准PosterBench进行评估。在主赛道中,AutoDesign取得78.32分,比Claude Design高7.45分。在七种代码智能体和模型配置中,整合学习得到的DesignHarness后,平均得分从54.99提升至67.39。完

Intern-S2-Preview:面向科学发现的智能体基础模型

Intern-S2-Preview是一系列面向科学研究的智能体基础模型,支持多模态理解、推理、生成和长周期任务。其训练流程结合科学多模态预训练、监督微调、可扩展的多任务强化学习、智能体强化学习和在线策略蒸馏。3970亿参数模型还将时间序列建模扩展到科学信号理解和数值预测。独立的Memory Decoder可以在不修改冻结的397B主干模型的情况下,快速进行科学领域专项适配。根据公布的评测结果,该系

Spatial Memory Agent:面向空间智能的经验驱动程序记忆

研究人员提出了 Spatial Memory Agent(SMA),这是一种运行时框架,能够在不更新模型参数、推理时也不依赖外部空间工具的情况下,提升冻结式视觉语言模型(VLM)的空间推理能力。SMA收集经过验证的空间经验,通过验证器引导的反思将其提炼为简洁且可迁移的经验规则,并根据后续检索结果为每条规则分配迁移可靠性分数。在部署阶段,系统通过语义筛选以及结合相似度和可靠性的排序机制检索相关规则,

蔚来 firefly 开始推送 Aster 2.0.0:新增沉浸式桌面和免麦克风唱歌

蔚来已开始分批推送 firefly 车型的 Aster 2.0.0 更新,重点升级智能座舱、语音助手 Lumo、车辆功能和驾驶辅助。更新新增 AI 生图功能,可结合模板制作个性化车机壁纸,并加入沉浸式桌面、自定义信息板和多种氛围主题。Lumo 现在可以查询沿途充电站,并通过语音控制露营模式、熄屏模式和免麦克风 K 歌。系统还新增免麦克风 K 歌、浏览器、多项流媒体服务、通勤模式,以及导航和停车功能

谷歌向美国所有13岁以上用户开放Ask YouTube

谷歌已将对话式搜索工具“Ask YouTube”正式开放给美国所有13岁及以上的登录用户。此前,该功能仅限YouTube Premium会员使用,目前可覆盖移动端、桌面浏览器和智能电视。用户可通过搜索栏中的提问按钮,以自然语言提出复杂问题。Ask YouTube会基于YouTube视频数据库生成结构化回答,提供相关视频片段,并支持在保留上下文的情况下继续追问。该服务目前仅在美国提供英语版本,谷歌表

研究系统分析混合线性注意力大语言模型中的大规模激活

该研究首次系统分析了交错使用线性注意力层和完整注意力层的混合大语言模型中的大规模激活。研究人员发现了两种与架构相关的形态:完整注意力层之前会出现激活尖峰,激活还可能持续穿过中间的线性注意力层,形成间歇平台。这些现象在五种线性注意力架构、六种混合配置、五个数据领域,以及参数规模从12亿到3970亿的开源模型中均得到观察。针对较小型 Gated DeltaNet 混合模型的受控实验表明,两种形态在训练

PlayWorld:利用代理玩家和长期目标评测世界模型

PlayWorld 是一个通过长期交互目标评估视频世界模型的基准。由于不同模型实现同一目标所需的动作序列可能差异很大,使用固定动作进行评测难以公平比较,因此研究人员让多模态代理玩家与各模型互动。该基准包含 171 个场景,评估几何一致性、交互保真度、视野外变化、状态持续演化,以及视频质量和可控性。对九个先进世界模型的实验显示,当前系统在长期交互目标上仍不可靠,尤其难以维持空间一致性和持续的状态变化

SpaceXAI称已建成全球最强AI训练集群,计划明年底前扩大约10倍

据Tom’s Hardware报道,埃隆·马斯克在SpaceXAI员工会议上表示,公司已建成“全球最强的AI训练集群”,并计划在明年底前将规模扩大约10倍。SpaceXAI位于孟菲斯和南海文的数据中心目前额定电力容量合计为1.4GW,计划在2027年底前提升至10GW。需要注意的是,电力容量不等于实际算力,冷却、网络、存储及其他系统也会消耗电力。马斯克以每瓦30至50美元的价值为前提,估算年收入可