AI 新闻中心

AI 新闻中心 过去一年分析了 8937 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

RIBOSPAN:用于多用途 RNA 建模的长上下文 RNA 基础模型

RIBOSPAN 是一个拥有 16.1 亿参数的双向 RNA 基础模型,原生以最长 10,240 个核苷酸的上下文进行预训练。该模型结合单核苷酸标记化、密集双向注意力和注意力隔离的序列打包机制,用于以高分辨率建模完整长链 RNA。评估显示,RIBOSPAN 在核苷酸重建和上下文表征方面表现出色,在多种 RNA 类型上取得整体领先结果,并在长 RNA 上保持明显优势。基于同一模型骨干,研究人员还开发

从生成到仿真:世界模型距离真正的模拟器还有多远?

该研究评估生成式世界模型能否取代物理引擎、游戏引擎和强化学习环境等传统模拟器。研究团队以资产构建、物理、交互、可控性、稳定性、状态反馈、多样性和评估指标八项能力为标准,分析了2018年至2026年6月发表的200项代表性工作。世界模型已在特定场景中实现交互和控制的功能性替代,但在物理定律的形式化保证、结构化状态反馈以及可复现的长期演化方面仍落后于传统模拟器。状态反馈是各技术路线共同且最被忽视的短板

华为重申不造车,称启境是智能汽车业务重要战略合作标杆

华为智能汽车解决方案BU CEO靳玉志重申,华为不会自行造车,而是将智能技术、工程能力和体系经验注入车企的整车开发。启境被定位为华为智能汽车业务的重要战略合作标杆。华为与广汽合作推出的首款车型、五座SUV启境GX7计划于9月上市。该车已在成都车展首次亮相,将搭载华为HarmonySpace 6智能座舱,并采用面向L3级自动驾驶的全链路八重冗余架构。

一次成功不等于可靠:Thinkingbox评估有状态业务工作流中的智能体

微软研究人员推出Thinkingbox,这是一个用于评估AI智能体的沙盒和基准测试,重点关注会修改后端持久状态的多步骤业务任务。Thinkingbox-bench包含507个受政策约束的工作流,覆盖零售、酒店、汽车保险、银行和IT支持等领域。系统通过可执行检查验证正确的状态转换,并拒绝缺失、错误或意外的影响。表现最强的模型在pass@1上达到65.36%,但pass^20仅为25.25%。结果表明

超越稳定性与探索的两难:用于大语言模型策略优化的环境正则化

一项研究提出环境正则化策略优化(ERPO),作为大语言模型训练中传统 Policy-KL 正则化的替代方案。ERPO 通过 Query-KL 项限制训练查询分布的偏移,同时不对响应分布施加直接的梯度压力,从而在提升训练稳定性的同时保留探索能力。该方法无需额外的前向传播,即可接入 GRPO、PPO 和 REINFORCE 类训练流程。在六项数学推理基准测试中,作者报告称,ERPO 提高了准确率,并在

EchoWM:开放且可进入的全模态世界模型

EchoWM 是面向交互式生成媒体的全模态世界模型。它能够响应连续导航,同时生成 720p 视频、环境音、音乐和语音。在第一人称场景中,镜头意图用于指定观察者的运动;在第三人称场景中,镜头与角色之间的动态关系则从数据中学习。离散指令和连续姿态会映射到统一的米制相对六自由度轨迹。研究团队通过专用数据引擎和渐进式训练,支持长时段生成,并保持环境音与语音同步。公开世界模型基准测试显示,该模型具备较强的轨

英特尔披露 Wildcat Lake 处理器:平台 AI 算力最高 40 TOPS,采用 UCIe 多芯片封装

据 Wccftech 报道,英特尔披露了 Wildcat Lake 处理器(又称酷睿 Series 3)的技术细节。该平台面向入门级 PC,AI 算力最高可达 40 TOPS,最高约为 Raptor Lake U Refresh 的 2.7 倍;创作与生产力性能最高提升 2.1 倍,处理器功耗降低 64%。为降低封装成本,Wildcat Lake 未采用 Panther Lake 的 Fovero

雷军详解小米新一代玄戒芯片原型机,展示端侧 AI 与个人超级计算终端

小米董事长兼 CEO 雷军介绍了两款搭载新一代玄戒芯片的原型机。玄戒 O100 原型机采用 O3 与 O100 双芯协同计算,面向端侧 AI 模型;小米称,搭载 MiMo 模型后,实测推理速度最高可达每秒 295 个 Token。AI Cube 原型机则整合 O3、O100 和 D100 三款芯片,配备 80GB 统一内存,可运行参数量达 1200 亿的模型及较小的端侧模型。目前两款设备均为原型机

DeepSeek-V4-PRO 测试:英伟达 Vera Rubin 每兆瓦吞吐量达 GB300 的 30 倍

英伟达使用 SemiAnalysis 的 AgentX 工作负载和 1.6 万亿参数的 DeepSeek-V4-PRO 模型,对 Vera Rubin 进行了评估。公开结果显示,Vera Rubin NVL72 的每兆瓦 Token 吞吐量约为 GB300 NVL72 的 30 倍。该基准测试主要评估智能体编程推理工作负载,指标包括端到端延迟、首个 Token 延迟以及生成阶段性能。测试还显示,G

广汽集团董事长冯兴亚再次拜访华为任正非,启境GX7计划9月上市

广汽集团董事长冯兴亚再次在深圳会见华为创始人任正非,双方围绕启境品牌下一阶段发展及合作展开交流。继启境GT7上市交付后,定位为五座智能百变SUV的启境GX7计划于9月上市。该车预埋L3级智能驾驶架构,并采用多重冗余设计,搭载华为相关技术,包括最多十块屏幕、前排双15.6英寸车载屏,以及88英寸大画幅增强现实抬头显示。上述内容属于已公布的产品规划和配置,并不代表车辆已经取得L3级自动驾驶的监管许可。

Block3D:通过分块扩散实现高效文本到3D生成

Block3D是一种文本到3D生成扩散框架,将离散的形状标记序列划分为连续区块。该方法以自回归方式生成各区块,同时对当前区块中的所有标记进行联合去噪。基于置信度的区块内校正机制会在每个区块最终确定前修正低置信度标记。在TRELLIS-500K的留出数据集上,Block3D将端到端平均生成时间从25.71秒缩短至4.99秒,相比经过微调的自回归基线提速5.15倍,同时未牺牲几何保真度。

一张被污染的网页就够了:评估 LLM 推荐系统中的网络内容污染

带搜索功能的 LLM 越来越多地利用实时网络内容进行商品推荐,因此可能被经过操纵的网页误导,成为虚假商品的无意推广者。研究团队推出 FORGE 基准测试,将检索网页中的真实商品替换为虚假商品,以评估模型的脆弱性。研究覆盖 225 件商品、15 个类别、5 种消费场景,以及 12 个商业和开放权重模型。结果显示,所有模型都存在漏洞:仅一张被污染的网页就能使虚假推荐率最高达到 27%;将排名前三的网页