AI 新闻中心

AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

内存墙的另一半:通过训练式路由预测从 SSD 运行 35B MoE

Edge0 是一款流式推理引擎,旨在让混合专家模型在消费级硬件上运行。经过训练的预路由器会提前一个 token 预测下一层将选择的专家,使所需权重能够从 SSD 预先读取,并与计算过程重叠。未合并的恢复 LoRA 用于弥补 int4 量化和替换原有路由造成的质量损失。在一台配备 24GB 内存的机器上,Edge0 可让 35B MoE 模型以每秒 20 个 token 的速度运行,峰值活动内存仅为

新报告称 AI 电子垃圾规模被严重低估,到 2050 年或可绕地球六圈

巴塞尔行动网络(BAN)发布新报告警告,AI 热潮产生的电子垃圾远超以往估计。到 2050 年,这些垃圾可能装满 2300 万个货运集装箱;若以 12.2 米集装箱首尾相连,长度足以绕地球六圈。过去研究多关注服务器和 GPU,BAN 则纳入供电与配电、冷却、备用电源和网络设备,约占总数据中心机电基础设施的 87%。BAN 创始人吉姆·帕克特表示,每个 AI 模型都依赖高度专业化的尖端硬件,呼吁政府

智谱 GLM 公布国内首个递归自我改进生产实践

智谱 GLM 团队披露了递归自我改进(RSI)在生产环境中的应用案例。由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试和优化。在超过 10 万张国产芯片组成的集群上,该系统不到两周便从零搭建生产级推理服务。智谱称,端到端吞吐量提升至初始基线的 3 倍,硬件利用效率和单 Token 成本达到主流 NVIDIA GPU 系统的相近水平。该

研究显示:印度外包行业几乎未受人工智能挤压

荷兰国际集团(ING)的一项研究显示,生成式人工智能迄今几乎没有取代印度外包行业。印度软件服务出口占国内生产总值的比重,已从疫情前的3.3%升至约5.2%。包括金融、会计、工程、研究和数据分析在内的商业服务,占GDP的比重也升至3.3%。ING认为,人工智能正在改变外包工作的内容,但尚未降低整体服务需求。行业增长正从数据录入、单据核验和客户支持等重复性工作,转向数据分析、软件开发、风险管理、工程设

每小时最高消耗3万美元:前DeepSeek研究员首次直播小米大模型训练

小米MiMo团队负责人、前DeepSeek研究员罗福莉在X平台首次公开直播了小米最新模型MiMo-V2.6的训练过程。团队目前正针对智能体系统开展大规模强化学习实验,并扩展计算资源、测试环境和评估方法。根据公开训练页面,MiMo-V2.6-Pro和Flash两个并行版本累计训练成本约128万美元,合计每小时消耗超过3万美元。小米方面表示,未来几周将逐步公开更多相关技术细节。这些数据反映出先进大模型

小米公开MiMo-V2.6强化学习训练过程,计划开源技术细节

小米MiMo团队负责人、前DeepSeek研究员罗福莉公布了MiMo-V2.6大模型强化学习训练的最新进展。小米同步上线实时页面,展示训练进度、Token消耗和成本。团队正在开展大规模多任务智能体强化学习实验,采用异步并行计算、支持多框架混合运行的环境,以及结合测试用例和评分标准的组内信用分配机制。根据公开数据,MiMo-V2.6-Pro训练约43小时,成本为89万美元;Flash版本训练约38小

消除长上下文混合专家训练中的每个内存峰值

研究人员提出针对长上下文混合专家(MoE)模型训练的内存优化技术。以往只要任一组件峰值内存超过设备内存,训练就会失败。研究识别出四个瓶颈:专家分发、词汇投影、梯度检查点边界和优化器状态。PipelinedLLEP、Ring-DTP、选择性检查点卸载(SCO)和 OffloadStreamAdamW 以固定 GPU 工作集限制这四者。这些方法仅改变计算顺序和粒度,因此损失和梯度保持精确。测试显示,M

PANORAMA:通过掩码候选选择实现全景接地描述

该研究针对全景接地描述任务,要求视觉语言模型同时描述前景物体和背景区域,并将每个短语关联到像素级掩码。作者推出了人工标注的 PanoCaps 基准,包含密集描述、近乎完整的像素覆盖以及实体级图文对齐,并提出 Generalized Panoptic Quality 评估指标。PANORAMA 使用预训练分割器生成由短语条件控制的掩码候选,再选择与每个短语对应的区域。在 PanoCaps 上,该模型

ChatGPT 背后贡献者 Almeida 推出 AI 模型 Jev,输出免费

TypeSafe AI 发布了 Jev,这是一款不生成文本或代码、而是返回结构化决策的“System One Model”。Jev 支持从最多 255 个预设选项中进行选择、输出数值评分,并提供经过校准的是或否概率。公司称,该模型采用“校准决策强化学习”(RLCD),旨在使模型置信度更贴近实际正确率。在结构化任务中,TypeSafe 宣称 Jev 比前沿大型语言模型快 20 至 200 倍,成本低

重新思考 PPO 中的评论家学习:理解并缓解价值扁平化

一项研究发现,用于训练大型语言模型的近端策略优化(PPO)评论家存在一种系统性失效模式。实际状态价值可能在不同中间状态之间剧烈变化,但评论家的预测却相对平坦,研究人员将其称为“价值扁平化”。在 FrozenLake 环境和 Qwen3-Base 上的实验表明,该现象可能与价值损失中的隐式方差惩罚,以及时间相关状态导致的冗余更新有关。研究提出 SParse Proximal Policy Optim

信心源于经验:从推理到智能体的经验式置信度估计

该研究提出 XConf,一种结合当前推理过程与过往评估经验来估计语言模型置信度的方法。系统会记录过去的任务、模型反思、自报置信度、结果,以及评分完成后总结的经验教训。面对新任务时,XConf 会检索任务相似且自报置信度接近的历史案例,并依据其历史成功率重新评估置信度。该方法无需访问 logits,也无需更新模型权重,每次只需生成一次答案。在涵盖推理、编程、多模态问答和交互式智能体的九项基准测试中,

SpectralShift:通过谱重参数化有效扩展 Gated DeltaNet 的上下文窗口

该研究探讨如何扩展用于长上下文建模的线性注意力架构 Gated DeltaNet(GDN)的上下文窗口。研究发现,远距离信息检索需要两个条件:足够宽的慢衰减状态动态频谱,以及保留用于状态清除和上下文切换的快衰减模式。SpectralShift 通过调整 alpha 投影的初始化来重塑衰减频谱,并对相关投影采用学习率缩放,以支持长上下文持续预训练。实验表明,该方法在训练过程中能够持续提升长上下文能力

面向大语言模型偏好对齐的零阶范式

论文提出了基于比较的偏好优化方法(ComPO),这是一种让大语言模型对齐人类偏好的零阶方法。ComPO不直接优化可微分的偏好损失,而是从偏好比较中提取更新方向信息。作者在特定假设下,为离线和在线版本建立了收敛性与性能保证。在Mistral、Llama、Gemma、Qwen和Gemma-3模型上的实验表明,ComPO优于现有的直接对齐方法,包括在长度控制胜率方面取得改进。

ActionPiece 重新思考自回归视觉语言动作模型的动作标记化

ActionPiece 是一种面向自回归视觉语言动作模型的动作标记化方法。研究人员提出 Physical Rank Consistency(PRC),用于衡量动作重建后是否保留不同动作之间的相对物理距离。该方法将关系监督与重建损失、量化正则化结合起来。在相同的 Qwen3-VL-4B 策略训练设置下,ActionPiece 在 LIBERO 上达到 94.8%,在包含未见场景的 LIBERO-Pl

小米直播训练 MiMo-V2.6,研究强化学习的扩展极限

小米 MiMo 团队在今年 4 月开源 MiMo-v2.5 后,已投入近半年研发 MiMo-V2.6,重点研究强化学习究竟能扩展到多大规模。目前该模型仍处于训练中期。团队扩展了计算资源、多任务智能体的环境与工具,以及用于评分和信用分配的计算资源。训练总成本已超过 125 万美元。小米计划在未来几周逐步公开更多技术细节,但模型的正式发布时间尚未确定。