科大讯飞发布星火 X2.5:293B-A30B MoE 模型,完全基于国产平台训练
科大讯飞正式发布多语言文本生成模型星火 Spark X2.5。该 MoE 模型总参数量为 2930 亿,推理时最多激活 300 亿参数,支持 256K 上下文。科大讯飞表示,该模型完全基于中国自主研发的平台训练,并提升了代码生成和智能体能力。模型支持 200 多种语言,可用于语言理解、问答和推理等通用任务。Spark X2.5 已上线科大讯飞星辰 MaaS 平台,价格为输入每百万 Token 1.
AI 新闻中心 过去一年分析了 9069 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
科大讯飞正式发布多语言文本生成模型星火 Spark X2.5。该 MoE 模型总参数量为 2930 亿,推理时最多激活 300 亿参数,支持 256K 上下文。科大讯飞表示,该模型完全基于中国自主研发的平台训练,并提升了代码生成和智能体能力。模型支持 200 多种语言,可用于语言理解、问答和推理等通用任务。Spark X2.5 已上线科大讯飞星辰 MaaS 平台,价格为输入每百万 Token 1.
腾讯微信视觉团队开源了通用多模态嵌入模型 WeMM-Embedding,支持文本、图像等输入。该模型提供 2B、4B 和 9B 三种规模,面向不同部署需求。其采用统一架构,并结合两阶段训练与知识蒸馏,在多模态理解能力和部署效率之间进行平衡。据腾讯介绍,WeMM-Embedding 已大规模部署于微信推荐与搜索系统,日调用量达到十亿级。此次开源使开发者能够使用一款已在大型商业服务中部署的模型,但公告
文章称,OpenAI通过Stargate计划,使用超过10万张英伟达GPU训练所谓的“Astra”模型。若计入服务器、网络、电力、散热和研发成本,相关基础设施投资可能达到100亿至250亿美元,这一数字来自媒体引用的估算。相比之下,DeepSeek计划在中国建设的数据中心据称将采购16万张华为AI芯片,投资约25.6亿美元。不过,Astra的存在、具体规格和相关支出目前均未得到公开证实。文章指出,
9月7日,千问开放平台上线10余款金融服务智能体,覆盖证券投资、基金、期货和保险。用户可在千问对话中直接调用相关服务,也可从首页进入。由不同金融机构提供的智能体支持市场与企业基本面分析、投资参考,以及保险产品核保要求对比等功能。千问生态目前已延伸至物流运输、房产、本地生活、汽车出行等十多个领域。此次扩容反映出AI应用正从通用对话转向面向具体行业任务的专业服务。相关功能属于分析和产品筛选辅助,不应替
据《日经亚洲》报道,美国预计将在9月24日与中国举行的会谈中提出人工智能安全问题。双方可能讨论如何防止由人工智能主导或辅助的网络攻击。中国也可能再次提出美国的出口管制措施。
大型语言模型正越来越多地用于将自然语言问题描述转化为优化模型。但现实中的运筹学需求通常缺少目标、约束条件或业务规则,而这些信息可能改变最终的数学规划模型。研究人员提出了 OR-Clarify,这是一个用于评估智能体能否在建模前识别必要澄清事项的基准。同时,他们提出两阶段框架 InterOPT,用于找出对建模至关重要的未解决信息,并决定继续提问还是停止。在选择题实验中,InterOPT 在准确恢复缺
中国算力芯片厂商摩尔线程9月7日早盘股价下跌20%,创上市以来新低,市值跌破2000亿元。此次下跌发生在公司首次公开发行网下配售的2577.45万股限售股解禁之后,该批股份占公司总股本的5.48%。财报显示,摩尔线程2026年上半年实现营业总收入17.36亿元,同比增长147.42%;归母净亏损为1156.31万元,同比收窄95.73%。公司此前还公告称,拟发行境外上市外资股(H股),并申请在香港
据韩媒 ChosunBiz 报道,SK 海力士第六代 10 纳米级 DRAM 工艺 1c 纳米,有望在 2027 年初超过 1b 纳米,成为该公司的主力 DRAM 工艺。预计 1c 纳米在 SK 海力士总 DRAM 产能中的占比,将从 2026 年第一季度的 10% 逐步升至 2027 年第一季度的 35%;同期 1b 纳米占比则可能降至 33%。SK 海力士目前仍在 HBM4 中使用 1b 纳米
美国普通投资者正利用基于 Claude 或 Codex 构建的 AI 智能体开发交易算法。他们将股票投资组合连接到这些系统,让软件自动执行部分投资策略。这一趋势催生了“机器人散户投资者”,但也带来了系统可靠性、风险管理和潜在金融损失等问题。
iRobot 在 IFA 2026 发布了 Roomba Duo,这是一套由扫拖一体主机和紧凑型副机构成的清洁系统。两台设备可实时通信,并利用 AI 协调清洁任务。主机负责清洁开放式地面,配备 PowerSpin Max 滚筒拖把,可提供 46 牛顿下压力。高度仅 83.5 毫米的 Roomba Plus 575 Combo Robot 主要清洁角落和边缘,可跨越 35 毫米高的门槛,并配备可向外
微博 CEO 王高飞分享了驾驶鸿蒙智行智界 R7 约 100 公里的体验,并高度评价华为乾崑智驾 ADS 5.0。他提到,系统在狭窄道路会车时会适度减速,在减速或安全降级时提示原因,还能辅助车辆驶出车位并完成转向。在一个后方紧邻出口的 Y 字形车位中,车辆通过多次打方向完成了原地掉头。不过,他将 ADS 5.0 与特斯拉 FSD V14 相提并论,主要是个人驾驶感受,并非标准化测试结论。他同时指出
一项研究表明,在循环神经网络中,状态被写回和保存的方式可能决定低精度推理的准确率。在用于荧光寿命成像的 GRU 编码器—解码器中,采用确定性的 4 位状态存储后,短寿命成分 τ1 和长寿命成分 τ2 的估计误差分别增加约 70 倍和 300 倍。原因是反复出现的小幅更新低于写入阈值,未能反映到存储状态中。误差反馈、残差记忆和方向记忆能够在无需重新训练的情况下恢复准确率。对独立训练的 LSTM 进行
MaxKernel 是一个用于设计和优化 TPU 定制内核的多智能体系统。它支持三种方式:人类参与的协作式设计、基于性能指标和追踪数据的全自动优化,以及用于更广泛探索设计空间的图搜索式自主探索。多个专业子智能体分别负责规划、实现、自我调试、测试和硬件性能分析。研究人员在 TPU 基准套件 JaxBench 的 50 项任务,以及先进开源模型的真实工作负载上进行了评估,并称该系统在许多情况下达到了专
一项研究分析了大型语言模型在修复漏洞时为何经常修改超出必要范围的代码。研究人员使用 BigCodeBench 的 400 个问题,注入受控的 AST 级错误,以衡量修复结果是否接近最小补丁。即使是 GPT-5.5 等强大模型,也经常产生不必要的大幅修改并增加认知复杂度。加入保留原有代码的指令后,过度 Levenshtein 距离从 0.195 降至 0.131,新增认知复杂度降低 26.6%,Pa
RISE 是一种语言模型后训练方法,可直接从模型自身的 RLVR 训练轨迹中构建合成教师模型。该方法在参数空间或输出 logit 空间中外推当前检查点与较早锚点之间的变化,从而生成密集的逐 token 监督信号,无需外部模型或特权条件信息。基于结果的奖励将外推引向正确推理,而蒸馏则改进逐 token 的决策。随着学生模型不断进步,教师模型也会持续更新,使蒸馏从一次性压缩步骤转变为递归改进机制。在数