AI 新闻中心

AI 新闻中心 过去一年分析了 4177 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

小米在澎湃 HyperOS 4 中焕新超级小爱交互体验

小米宣布为澎湃 HyperOS 4 中的 AI 助手超级小爱带来全新交互体验。新版通过轻量动效提供实时反馈,任务可在超级岛上持续运行,思考结果也会自动展开并清晰呈现关键信息。此前发布的超级小爱 8.2 已支持自动识别号码以及根据实时气温调节车内设置的语音指令功能。该更新将面向澎湃 HyperOS 4 Beta 用户分批推送。

男子听信 AI 抄近道下山被困深山,最终获救

中国宁波一名57岁男子向 AI 询问下山路线,并按照建议避开溪床、前往较高处的山坡。但当地灌木茂密、坡陡湿滑,行进难度不断增加。男子多次折返后体力耗尽,只能报警求救。消防人员通过实时位置共享重新确定搜救方向,最终找到他并将其安全护送下山。脱险后,男子告诉 AI,自己本应直接沿导航提示的成熟路线下山;AI 也承认,如果当时跟着导航走,就不会在陡峭的野沟中遭受这么多罪。事件说明,在涉及人身安全的户外导

DreamX-Creator 推动 2K 原生音视频生成普及

DreamX-Creator 1.0 是一套可联合生成视频和音频的紧凑型系统。其 70 亿参数生成器先分别处理视觉与音频流,再通过带门控的跨模态注意力机制进行耦合。系统采用经过筛选的时序一致多模态数据、渐进式联合训练,以及利用模态感知反馈的强化学习。针对 2K 输出,团队设计了一个精炼流程,将模型压缩为每个时间片段只需进行一次去噪评估。开发团队公开了 7B 生成器和 2K 精炼器,以支持统一音视频

GenFirst:先生成后重建,实现稳定的端到端潜在生成建模

潜在生成模型通常采用两阶段训练:先用变分自编码器学习重建,再在冻结的潜在空间中训练生成模型。研究人员指出,为重建优化的潜在表示不一定适合生成。分析表明,KL 散度目标中的熵项对于防止潜在空间坍塌至关重要,同时重建的学习速度更快、监督更强。GenFirst 因此先通过生成目标塑造潜在空间,再逐步加强重建,以恢复视觉细节。在 ImageNet-256 上,SiT 使用 CFG 时取得 0.97 的 g

Matrix-Game 3.5借助Patch Memory增强实时流式交互世界模型

Matrix-Game 3.5是一种用于实时生成持久虚拟环境的交互世界模型。新版本引入结合Patch Memory与tiled-PRoPE的几何感知记忆框架,将静态场景几何与动态主体分开建模,并通过两阶段渐进式蒸馏实现快速因果生成。这些改进旨在提升长时间场景记忆、精准摄像机控制、主体一致性和提示词驱动的世界生成能力。模型使用来自Unreal仿真环境、开放世界游戏和互联网视频的数据进行训练,研究团队

基础模型协同架构推动实体智能体实现长时程导航

NavMCP将负责高层推理的视觉语言模型与负责闭环执行语义子目标的导航基础模型结合起来。意图、观测和记忆三个通道使系统能够决定需要寻找哪些证据,将导航过程转化为有依据的轨迹信息,并在多次调用之间保存发现、否定性证据和未解决目标。该方法无需重新训练任一模型,就能把孤立的导航回合转变为持续的具身交互。NavMCP在HM-EQA、MT-HM3D和EXPRESS-Bench上取得当前最佳结果,在HM-EQ

PaperBanana-Interact:通过多轮人类反馈改进科学图表

PaperBanana-Interact研究如何利用多轮人类反馈迭代改进科学图表。研究人员发布了MTPaperBananaBench基准,其中包含292张图像和3,518项经过标注的用户需求,并构建了用于大规模评测的用户模拟器。对现有多轮系统的评估发现了两种常见失败模式:随着轮次增加,图表质量逐步下降的“质量漂移”;以及后续修改丢失此前已实现功能的“遗忘”。PaperBanana-Interact

CogEvol:面向高效可靠的学习环境生成

CogEvol是一系列专为学习环境生成设计的模型,可将课程简介一次性转换为完整的学习内容,包括结构化JSON幻灯片和自包含的交互式HTML页面。开发团队称,该系统基于22万次生产请求开发,生成一页幻灯片的中位时间为17秒,生成交互式页面为59秒。CogEvol-27B在幻灯片质量评测中得分83.7,在包含500个案例的交互式HTML基准测试中得分63.7。CogEvol-4B已依据Apache 2

Lucida:解析、生成并放置物体,实现可组合的真实场景到仿真建模

Lucida是一种将真实室内环境重建为完整、可编辑三维物体资产的方法,面向机器人仿真和具身智能。系统首先构建场景图,为每个物体保留多视角证据;随后根据这些证据生成完整资产,并通过GizmoAct完成物体放置。视觉语言模型以闭环GUI交互的方式控制放置过程,并自行判断对齐是否达到要求。根据论文作者报告,Lucida在R2S-Scene上的mAP较Boxer提升69%;在CA-1M上,ADD-SB@0

BLARM:通过融合潜在刚性运动基元从视频生成3D物体动画

BLARM是一种由视频驱动静态3D网格动画的前馈方法。给定单目视频和物体网格,系统能够生成时间上连贯的动画网格,无需显式骨架、笼状模型、蒙皮权重或绑定标注。该方法使用一组随时间变化的学习型刚性运动组件,以及将顶点分配给组件的时间不变权重来表示运动。几何特征和视频特征通过分解式时空注意力进行融合。训练过程结合轨迹重建、熵正则化和运动感知对比学习,旨在通过低维变形空间生成准确、稳定且具有一定可解释性的

先学会评估再改进:面向自主科研智能体的自动评估规则生成

AutoSciRub 是一个面向自主科研智能体的框架,能够在研究开始前生成针对具体任务的可执行评估规则。它将定义不充分的研究指令拆解为原子化科学目标,并结合相关文献和可用数据,制定具体且可验证的标准。评估规则可指导实验与分析;逐项验证则能发现未满足的要求,并针对性地改进研究报告及其支撑成果。在 ResearchClawBench 和 AstaBench E2E Discovery 测试中,Auto

微软高管警告:低质量 AI 内容正在稀释职场信息价值

负责 Office 与 LinkedIn 业务的微软执行副总裁瑞安·罗斯兰斯基表示,低质量 AI 生成内容已进入日常办公场景。由 AI 生成、AI 阅读、AI 摘要构成的循环,可能让信息在反复改写中逐渐失去价值。生成式 AI 可以加快初稿、摘要和信息整理,但不能自动保证事实准确、逻辑完整或产生新的洞见。企业在关键决策、数据核验和观点形成环节仍应由员工负责。LinkedIn 已推出“看起来像 AI

科大讯飞开源端侧模型,支持百万 Token 上下文

科大讯飞旗下词元星火发布了开源模型星火 X2.5-4B 和星火 X2.5-1.7B。两款模型原生支持最长 100 万 Token 的上下文窗口,并针对智能体、代码、数学和指令遵循等能力进行优化。据介绍,模型在国产算力平台上完成全流程训练,使用了约 20 万亿 Token 的多样化数据。在 Domux 智能家居测试集上,1.7B 模型的控制指令端到端执行正确率达到 90.3%,平均响应时间为 0.8

通义千问升级学习功能:新增教材同步作文辅导,互动讲解扩展至高中大学理科

阿里巴巴旗下AI助手通义千问在新学期升级学习功能,并将相关功能全部免费开放。此次更新新增与教材同步的作文辅导,以及初中语文、数学精讲;拍照解题和互动讲解能力则扩展至高中、大学的数学、物理、化学。作文辅导不会直接给出范文,而是通过连续提问,引导学生分析题目、整理素材并搭建文章结构。教材讲解会结合学生已学知识,帮助理解新概念。学生在理工科推导过程中遇到疑问时,也可以随时追问某一步的依据,系统会根据问题