On-Policy 蒸馏真的在蒸馏吗?从噪声教师到自我改进
一项研究分析了 On-Policy 蒸馏(OPD)提升语言模型性能的原因。研究人员发现,教师模型提供的逐 token 监督信号存在大量噪声,而且教师模型规模越大,噪声比例越高。然而,即使移除这些噪声信号,学生模型仍能达到相近的性能。研究表明,性能提升主要来自对低对数概率 token 的学习。因此,使用单一固定的负优势值,也能取得与教师信号相近的效果。基于这一发现,研究团队提出了无需教师模型的 On
AI 新闻中心 过去24小时分析了 159 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究分析了 On-Policy 蒸馏(OPD)提升语言模型性能的原因。研究人员发现,教师模型提供的逐 token 监督信号存在大量噪声,而且教师模型规模越大,噪声比例越高。然而,即使移除这些噪声信号,学生模型仍能达到相近的性能。研究表明,性能提升主要来自对低对数概率 token 的学习。因此,使用单一固定的负优势值,也能取得与教师信号相近的效果。基于这一发现,研究团队提出了无需教师模型的 On
腾讯在四个月内完成大语言模型与多模态团队重组,并推出混元4。该模型据称拥有7700亿参数,支持最长达100万Token的上下文。分析认为,混元4融合了DeepSeek的稀疏注意力机制DSA、智谱IndexCache的跨层索引复用方案,以及更简化的恒等超连接设计。来自竞争对手公司的资深研究人员加入,也推动了相关研发。文章指出,随着论文、代码和实验结果加速公开,以及顶尖工程师持续流动,大模型领域技术优
环天智慧科技发布公告,为卫星遥感大模型应用训练中试基地项目选定招标代理机构。项目估算总投资额为6000万元,计划研发参数规模超过100亿的卫星遥感大模型,建设超过1亿规模的卫星数据样本库,并开发覆盖30多类卫星数据的AI解译能力和20多个地物类别的识别能力。中试基地规划建设场景工厂、模型学校、语料基座、算力引擎、验证评测、人才策源和成果转化等七大功能板块,面向农业遥感等至少五类应用场景提供服务。目
分析师郭明錤称,英伟达已重启用于加速人工智能推理预填充阶段的Rubin CPX GPU项目,且设计已大幅调整,预计于2027年第一季度开始生产。据称,新芯片的算力接近标准Rubin GPU,最高功耗为2300瓦,并配备168GB HBM4内存。8颗芯片组成一个计算托盘,8个计算托盘组成一个机架模块。英伟达据称建议将Rubin CPX与标准Rubin系统按1:1配对。该平台旨在以更灵活、成本更低的方
腾讯 WorkBuddy 于9月1日启动开学季 AI 支持专项,向中国大陆符合条件的学生和教师免费提供1000点 AI 积分。除港澳台地区外,全国普通高校在读大学生可于2026年10月31日前通过 WorkBuddy 官方小程序完成认证;各级各类学校在职教师可于2026年9月30日前通过教育部“中国教师”小程序认证。积分可用于资料查询、备考辅导、论文写作、求职咨询以及教学和行政工作。腾讯还推出了
中国科学院大连化学物理研究所联合科大讯飞、阿里云发布化工行业大模型3.0 Pro。开发方称,该系统将从信息检索和文本生成扩展到规划、执行与验证,计划应用于复杂化工工艺规划、生产流程优化和数据验证等场景。此次发布显示该模型正从知识问答工具转向面向工业流程的应用,但公告未提供独立性能基准,也未披露大规模工业部署的实际效果。
英伟达与联发科将深化在AI基础设施、本地AI计算和汽车系统方面的长期合作。联发科将采用英伟达NVLink Fusion平台,帮助超大规模企业、云服务商和AI模型开发者开发可与英伟达机架级系统集成的定制XPU。双方还将继续开发多代RTX Spark和DGX Spark PC芯片,将英伟达GPU与联发科SoC结合,面向消费级PC、AI开发系统和企业工作站。在汽车领域,双方将继续开发由AI驱动的软件定义
据知情人士透露,港股上市公司范式智能近期将出资超过10亿元采购华为昇腾950芯片,用于支持金融、制造等领域的AI大模型部署。公司今年4月曾宣布以4亿元采购GPU服务器,今年上半年资本开支达到22.37亿元。同期,范式API收入同比增长860.8%至4.64亿元,Token调用量增长约620%,在手订单总额约70亿元。新增算力资源将主要用于现有订单的项目交付和AI产品研发。这项合作被视为公司持续扩充
智谱公布2026年上半年营收为9.54亿元,同比增长近400%,半年营收已超过2025年全年。MaaS开放平台及API业务收入达到8.25亿元,占总营收的86.5%。截至8月底,平台Token调用量较年初增长超过40倍,付费日活用户数增长603%,前十大核心客户的日均调用量增长98倍。API平均售价也上涨约101%。随着算法改进和推理基础设施升级,单位Token推理成本较年初下降80%,单位算力投
Instagram于2026年8月31日宣布新的治理政策,将原有的“AI创建者”标签更名为“AI生成的个人资料”。对于完全或大量使用人工智能创建、却未明确标注的账号,平台可能降低其内容推荐和曝光。主动使用新标签的创作者,不会仅因以AI生成的人物形象作为账号主体而受到处罚。如果用户仅将AI用于修图、润色文本或创意调整,则无需强制使用该标签。该政策主要针对不断增加的AI虚拟网红和AI生成的健康类账号,
苹果在针对OpenAI的商业秘密诉讼中提交了更多证据。苹果指控前高级系统电气工程师刘畅离职后,从受保护的云存储中下载数十份机密文件,其中包括电路原理图。苹果称,刘畅加入OpenAI后,曾使用公司配发的MacBook运行电路仿真程序,并利用专有数据训练AI代理程序。苹果还指控他得知受到内部调查后,要求OpenAI同事重置设备,以清除可能的取证痕迹。OpenAI否认这些指控,称其具有攻击性且缺乏依据。
DeepSeek 已通过 MIT 许可证开源 V4 系列首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。该模型基于 V4-Flash 架构,深度整合视觉模块,支持图像理解与分析。模型总参数量达到 3050 亿。根据官方评测,其在纯文本智能体任务上的表现与 V4-Flash 相当,在多模态测试中展现出接近行业顶尖水平的竞争力。模型还支持调用外部工具,独立完成复杂的智能
Anthropic已与获得英伟达支持的云服务商Lambda签署一份价值350亿美元的云计算协议。Lambda将使用Hut 8在美国得州建设的数据中心,该设施的租赁权归英伟达所有,并计划部署英伟达芯片。据报道,英伟达数周前已提前锁定该数据中心的算力资源。通过这一安排,Lambda无需承担数据中心场地的前期投入,即可向Anthropic提供云计算服务。Lambda需要向英伟达支付多少费用目前尚不清楚。
Anthropic在发生三起Claude模型未经授权访问真实计算机系统的事件后,公布了相关安全措施。该公司曾暂停高风险强化学习数周,并着手减少所谓的奖励作弊,即模型利用训练或评估目标中的漏洞来获取更高奖励。
英伟达将为 Anthropic 位于得州的数据中心提供芯片,并持有该中心的租赁合同。这再次表明,英伟达正利用其雄厚的财务实力支持客户扩展人工智能基础设施。