AI 新闻中心

AI 新闻中心 过去24小时分析了 191 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

面壁智能开源 MiniCPM5-2B:在 40 亿参数以下开源模型中排名靠前

面壁智能与 OpenBMB 社区开源了 20 亿参数的 MiniCPM5-2B,这是一款面向端侧设备的语言基础模型,支持工具调用、深度搜索和代码生成等任务。开发方称,该模型已初步具备端侧通用智能体能力。根据引用的 Artificial Analysis Intelligence Index 评测,MiniCPM5-2B 在参数量低于 40 亿的开源基础模型中综合排名第一。在涵盖代码与数学推理、指令

ReactVAU:用于流式视频异常理解的慢快解耦框架

论文提出了ReactVAU,一个用于实时检测和理解流式视频异常的框架。现有方法通常依赖离线推理和全局时间采样,难以满足因果处理要求,也不适合部署在实时监控系统中。ReactVAU由三个部分组成:基于Spatial Grid Folding的轻量级快速检测模块、用于保护关键信息免受时间衰减影响的异常感知持久记忆,以及仅在出现可疑事件时启动的高成本慢速推理模块。慢速模块在正常视频片段中保持休眠,仅对可

中国联通与魅族发布4英寸语音交互AI手机“小魔方”

中国联通与魅族发布了AI原生终端“小魔方”,产品重99克,配备4英寸方形屏幕,搭载云智OS,主打语音操控、AI服务、智能通话和端云协同。据介绍,设备可执行点咖啡、控制智能家居等任务,并利用摄像头和大模型识别现实环境中的物体、提供相关信息。通话功能包括中英文实时翻译、AI速记、通话摘要、待办事项生成、无障碍接听和情绪识别。小魔方支持本地手机与云端手机双身份切换,可协同使用应用、数据和算力,并提供2T

OpenAI韩国负责人:与三星电子的下一代芯片合作进展顺利

OpenAI韩国负责人表示,与三星电子开展的下一代芯片合作进展顺利,但三星电子称无法确认与客户相关的信息。OpenAI还计划继续与韩国半导体供应链企业合作,并在韩国建设AI推理基础设施,以降低跨境数据流动带来的监管风险。公司称,韩国ChatGPT Enterprise、Work、Codex用户以及ChatGPT周活跃用户均大幅增长。

RoboSPA:VLA 模型能否超越简单场景和短期任务?

RoboSPA 是一个用于评估机器人操作中视觉-语言-动作(VLA)模型空间推理和程序推理能力的大规模数据集与基准。它涵盖 10 个任务类别、56 个基础任务,以及分布在五个难度等级中的 280 个变体,空间歧义和程序复杂度逐步提升。数据包含来自多种机器人形态和不同场景的 52.7 万条轨迹。除任务成功率外,RoboSPA 还引入了更细致的诊断指标。实验表明,当前 VLA 模型在复杂空间关系、精确

CoVeR:面向视觉语言模型多视图三维推理的覆盖度令牌剪枝

多视图图像让二维视觉语言模型能够利用预训练知识推理三维场景,但也会产生数千个冗余视觉令牌。CoVeR是一种确定性、无需训练的选择方法,仅使用令牌坐标来最大化空间覆盖度。它能够执行精确的令牌预算,并避免选择近乎重复的令牌。在四个视觉语言模型上测试时,CoVeR在三个三维推理基准上均超过此前的最佳方法。仅使用约8%的视觉令牌,它仍保留了完整令牌配置下93.5%的性能,并在各基准上的平均成绩上领先此前最

AuK:用于语音生成与编辑的开源基础模型

一份技术报告介绍了 AuK,这是一款通过自然语言指令和音频上下文统一语音生成与音频编辑的开源基础模型。该模型使用约 30.3 亿条指令—音频实例进行训练,相当于 195 万小时的有效监督数据,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。AuK 将多模态大语言模型、在语音、通用音频和音乐上联合训练的 VAE,以及混合式 Rectified Flow Transformer 结合

京东启动物理 AI 加速计划

京东宣布启动物理 AI 加速计划,聚焦数据、机器人、制造、销售、物流和服务六大方向。公司计划在两年内采集超过 1,000 万小时的人类真实场景数据,并结合网络、仿真和真实机器人数据,开发具备通用能力的具身智能技术。未来五年,京东计划在中国布局 80 个机器人基地,建设覆盖展示、交付、维修、研发和制造等环节的全生命周期服务平台。此外,公司计划采购超过 300 万台机器人、100 万台无人车和 10

京东物流计划五年内采购300万台机器人,打造全球最大维修服务网络

京东物流宣布,未来5年内将采购300万台机器人、100万台无人车和10万架无人机,进一步推进物流全流程自动化。公司还计划建设覆盖全球100多个国家的机器人维修服务网络,并创造超过10万个机器人售后服务工程师岗位。京东零售计划在2028年前投入大量资源,扩大机器人的销售和应用。与此同时,京东正开展员工转型培训,帮助快递员、仓管员和质检员学习机器人维修技能。首批学员已完成培训和岗位认证,并正式转岗为机

BeaconKV:由信标查询引导的大型推理模型高效推理键值缓存压缩

大型推理模型会生成很长的思维链,导致键值(KV)缓存随序列长度线性增长,并造成严重的 GPU 内存瓶颈。该研究发现,现有压缩方法可能忽略推理后续会重新关注的远距离上下文。BeaconKV 是一种无需训练的方法,通过保留相似查询簇的紧凑代表——信标查询,来预测将被再次访问的 KV 对。在四个开源推理模型和多个基准测试上的评估显示,该方法最多可将内存占用降低 5.8 倍,在基本保持完整缓存准确率的同时

TransNormal-2:基于几何的 Rectified Flow 与边缘感知解码,实现精确法线估计

TransNormal-2 是一个基于 FLUX.2 的 Rectified Flow 框架,用于从单张图像估计表面法线。研究指出,VAE 编码器和解码器的八倍空间压缩是造成像素级误差的重要来源,尤其会影响物体边界。该方法结合了几何感知的像素空间损失,包括逆渲染一致性、von Mises–Fisher 角度损失和小波边缘正则化,并加入由 RGB 引导的轻量级几何细化模块。系统支持单步确定性推理。在