谷歌发布多语言AI战略,让全球每种语言都能被听见与理解
谷歌发布全球语言人工智能领域的新成果,称其技术和产品已支持超过300种语言,覆盖约86%的世界人口。其战略重点是发展原生音频智能,让Gemini等模型直接处理和理解音频,而不是仅依赖“语音转文字”的传统流程,从而保留语调、情感、节奏和上下文。谷歌介绍了支持70种语言的实时口语翻译、适用于嘈杂环境和专业术语的语音转写,以及Gboard中的语音重写功能。为覆盖低资源语言,谷歌推进“1000种语言计划”
AI 新闻中心 过去30天分析了 1693 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
谷歌发布全球语言人工智能领域的新成果,称其技术和产品已支持超过300种语言,覆盖约86%的世界人口。其战略重点是发展原生音频智能,让Gemini等模型直接处理和理解音频,而不是仅依赖“语音转文字”的传统流程,从而保留语调、情感、节奏和上下文。谷歌介绍了支持70种语言的实时口语翻译、适用于嘈杂环境和专业术语的语音转写,以及Gboard中的语音重写功能。为覆盖低资源语言,谷歌推进“1000种语言计划”
据网络社区消息,OpenAI和Anthropic正在内部测试名为GPT-6 Sol与Opus 5.2的新模型。Anthropic据称已在Claude Code中向部分用户开放Opus 5.2,网页端则大多仍使用Opus 5.0。早期测试者宣称,新版本在动画表现、前端开发和3D渲染等方面有大幅提升,但这些说法尚未得到独立验证。关于GPT-6 Sol,用户据称可通过更新的知识截止日期识别测试通道,并反
vivo发布了覆盖语音、端侧和云侧应用的新一代AI智能体大模型矩阵,并宣布正在研究可在智能手机上运行的300亿参数MoE模型。公司称,该研究旨在提升多模态理解、长上下文推理和复杂任务自主执行能力。发布会还展示了编程智能体BlueCode预览版,以及OriginOS 7和蓝河操作系统4。30B模型目前仍处于研究开发阶段,实际性能和上市时间尚未公布。
据消息人士透露,总部位于上海、从字节跳动分拆出来的 Anew Labs 已从 HSG、IDG Capital 及其他投资者处融资 2.9 亿美元。该公司专注于利用人工智能进行药物研发,此轮融资后估值达到 15 亿美元。
智界 RX 已在中国正式获得 L3 级自动驾驶道路测试牌照。华为高管余承东表示,该车目前正在公开城市快速路等复杂道路上有序开展实测。作为一款全新轿跑 SUV,智界 RX 基于华为途灵平台打造,配备 38 个融合感知传感器,包括 896 线双光路图像级激光雷达和 3 颗高精度固态激光雷达。该车预售价为 29.98 万元起,搭载 L3 级自动驾驶架构的版本售价 35.98 万元起。此次牌照仅意味着车辆
SiFive 与 AMD 在 AI Infra Summit 上展示了一套由 RISC-V 处理器和 AMD Radeon AI PRO R9700 显卡组成的系统。该系统使用 ROCm 10.0 运行了 Google 的 Gemma4-E2B 模型。两家公司将继续评估 ROCm 在 RISC-V 服务器上的优化方案,以提升处理性能,并在未来支持更多加速应用和更大规模的模型。这次演示是探索在 RI
联想已开始预热 YOGA Pro 15 RTX Spark 国行版。该机搭载英伟达 RTX Spark N1X 超级芯片,预计近期公布更多信息。联想此前在 IFA 2026 上发布了 15 英寸 Yoga Pro 9n 和 16 英寸 Yoga 9n 二合一机型。Yoga Pro 9n 配备 15.3 英寸 OLED 屏幕,分辨率为 2560×1600,支持 48 至 165Hz 可变刷新率,HD
字节跳动已将豆包大模型Doubao-Seed-2.1-pro升级至0915版本,并在火山引擎火山方舟平台全面开放API。官方称,新版本强化了证据溯源、权威信源检索、信息时效判断和数据核验,面向多工具调用和长程智能体任务提升稳定性。同时,模型增强了对大型代码仓库的跨文件编程能力,并优化了图像、视频推理的Token效率。飞书8.0推出团队智能体“豆包工作伙伴”,可加入群聊,并在授权范围内调用文档、会议
英特尔CEO陈立武在Splunk.conf26大会上表示,由于CPU供应紧张,英特尔目前只能满足约50%的客户需求。随着AI推理和AI智能体持续发展,CPU需求预计将进一步增长,因为CPU需要协调多块GPU并管理应用程序。陈立武还强调,同时掌握芯片设计、制造和先进封装能力具有战略意义。英特尔正寻求获得更多AI芯片制造订单,并将EMIB先进封装技术作为台积电CoWoS的竞争方案。不过,英特尔晶圆代工
火山引擎宣布将豆包 2.1 Pro 更新至 0915 版本,并通过火山方舟 API 全量上线。此次更新面向企业生产场景,官方称重点提升了 Agent 的证据溯源、权威信源检索、时效判断和数据核验能力,同时增强多模态 Coding、图像与视频理解,以及复杂代码仓库分析能力。模型可据称读取设计稿、工程图纸和操作录屏,将视觉信息转换为前端代码或游戏逻辑。豆包工作、TRAE 和 Doubao-Seed-E
中国移动发布了 Open-RAIL,这是一个用于连接视觉-语言-动作(VLA)、全身控制(WAM)模型与实体机器人的开源工程平台。平台通过轻量级硬件抽象层,统一机器人控制、状态读取和动作执行,使模型推理、真机运行、数据采集和模型迭代形成闭环。据介绍,Open-RAIL 目前已适配 4 款异构机器人和 10 个主流 VLA/WAM 模型。新机器人接入时间可由数周缩短至数小时,新模型通常只需 50 至
华为宣布启动“小艺 Work”内测,定位为面向日常办公、代码开发和创意创作的 AI 工作助理,支持鸿蒙及 Windows 系统。该服务可自主拆解任务、调用工具并推进执行,支持手机、平板等移动端远程下发任务、查看进度并接管多台电脑。在底层算法上,该服务融合了 DeepSeek、华为云盘古、MiniMax、智谱 AI 及月之暗面(Moonshot)等多家大模型。会员数据保留规则根据付费情况有所不同,其
据韩媒报道,三星电子正扩大通用存储器模组制造的外包规模,以将更多自有资源转向先进 AI 半导体后端生产。三星目前严重缺乏半导体洁净室空间和制造设备。报道指出,使用位于韩国温阳和天安的现有封装厂生产 DDR5 内存模组、固态硬盘等通用产品,可能并非高效利用产能。因此,三星希望由制造合作伙伴承接更多通用产品订单,释放自有资源用于高阶产品扩产。Dreamtech、HANYANGDGT 和 SFA Sem
在 2026 vivo 开发者大会上,vivo 发布了 OriginOS 7。全新的 vivo 输入法能够理解当前聊天上下文,并根据对话内容提供候选结果。例如,朋友要求发送身份证时,输入法会直接推荐“身份证”,用户无需退出聊天或手动输入,即可搜索并发送。在群聊中,输入法还可以理解用户不熟悉的话题,弹出相关搜索词,帮助用户更快了解内容。
苹果详细介绍了 iPhone 18 Pro 和 iPhone 18 Pro Max 上的 Apple Reference Image 功能。可选的 Reference 模式会在拍摄时通过 Secure Enclave,为焦段、数字变焦等关键元数据签名,并嵌入加密时间戳。该系统旨在证明图像来自真实传感器,并提高后续篡改的难度。苹果还将通过包含 Private Cloud Compute 的验证链确认