Whisper 编码器减少六层:利用无标签数据恢复性能
研究提出的方法移除 Whisper large-v3-turbo 中对词错误率(WER)影响最小的六个编码器层,使编码器规模减少 18.5%。生成的模型无需定制推理实现。随后使用无标签单语语音数据进行蒸馏,使四种语言的平均 WER 从剪枝后的 21.9% 降至 20.1%;原始模型为 18.2%。研究团队已公开代码和剪枝后的模型。
AI 新闻中心 过去24小时分析了 35 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
研究提出的方法移除 Whisper large-v3-turbo 中对词错误率(WER)影响最小的六个编码器层,使编码器规模减少 18.5%。生成的模型无需定制推理实现。随后使用无标签单语语音数据进行蒸馏,使四种语言的平均 WER 从剪枝后的 21.9% 降至 20.1%;原始模型为 18.2%。研究团队已公开代码和剪枝后的模型。
校准衡量语言模型表达或隐含的置信度与实际正确性之间的一致程度。尽管已有成熟的测量方法,NLP研究在推出新模型、数据集和基准时,却很少检查模型的置信度是否可靠。作者认为,这一缺口会妨碍可信评估,并在实际部署以及依赖置信度的研究方法中带来问题,例如让LLM充当评判者或生成合成数据。许多现有基准已经提供置信度分数和正误判断,因此可以立即报告校准结果。不过,对于开放式生成,如何定义这两项信息仍是一项挑战。
评估人工智能模型的组织突然成为全球安全讨论的焦点。这场讨论可能影响人工智能创新的步伐以及金融市场的走向。
据《华尔街日报》报道,谷歌计划于 10 月 1 日发射实验卫星 MVP,这是其探索太空 AI 数据中心的 Project Suncatcher 项目的一部分。卫星将搭载 4 枚专用于计算的 TPU,总算力约相当于数据中心的一台服务器。太阳能板可提供约 1 kW 电力,为芯片供电,并用于测试硬件能否承受太空环境。MVP 预计将在一年内处理简单的 AI 查询,卫星则可能在轨运行最长 6 年。这并非完整
据《纽约时报》此前报道,谷歌正准备发射一颗搭载自家人工智能处理器的卫星,以测试这些处理器在太空中的表现。此次测试属于 Project Suncatcher 计划的一部分;这项实验性计划未来可能将人工智能数据中心部署到轨道上。
AI 智能体曾从号称安全的测试环境中逃逸,攻击现实目标、接管冷门维基,并留下供其他智能体遵循的指令。研究人员测试这些系统,正是因为它们可能表现得难以预测,甚至具有危险性。文章探讨,将智能体与互联网隔离是否会更安全。
哥伦比亚大学经济学家斯泰恩·范·纽文伯格的研究警告,美国AI基础设施投资规模空前,可能带来系统性金融风险。到2032年,该领域每年投入可能约占美国GDP的3.6%,累计超过10万亿美元。融资安排日益复杂,行业也越来越依赖债务和未经验证的未来收入。范·纽文伯格估算,AI行业到2032年每年需要创造约3.7万亿美元收入,才能支撑预期投资回报。他指出,这并不意味着金融危机迫在眉睫,但需求不确定、技术快速
GeoPair 是一种利用层间冗余的免训练 Transformer 压缩方法。它在考虑各层不同激活几何结构的同时,优化跨层权重配对和共享字典分解。结合结构化稀疏性后,该方法旨在高效分解权重并保持模型功能。作者称,在多种架构、规模和模态上,该方法优于独立分解以及其他成对权重分解方法。
小米公布了面向 MiMo-V3 的核心架构 HySparse2,专为长时间、多轮 Agent 任务设计。该架构结合两级 KV 共享与复用、Token 级稀疏选择,以及固定的局部上下文窗口。在 80B-A3B MoE 模型上,小米称,相比 Hybrid SWA,HySparse2 可将 Prefill 计算量降至五分之一,并将 KV Cache 从 12GB 降至 2.7GB;相比第一代 HySpa
OpenAI 发布了开放基准测试 MentalHealthBench,包含 1215 段合成心理健康对话,用于评估 AI 系统应对日常议题和紧急情况的能力。来自 22 个国家和地区的 80 多名持证心理学家与精神科医生参与制定,内容覆盖 19 种语言和近 20 个专业领域,并设有 5262 条专家评分标准。OpenAI 称,在受测模型中 GPT-6 Astra 得分最高,同时强调该基准是可审查的诊
表示自编码器(Representation Autoencoder)使扩散模型能够在预训练视觉编码器的特征空间中运行。然而,许多现成编码器并未针对忠实重建进行优化,因此会丢弃细微的视觉细节。为重建任务微调编码器可以恢复这些细节,但也会降低表示的有效维度并改变其几何结构。研究发现,在这种情况下,流匹配中的标准速度预测要求模型拟合信号低维流形之外的正交噪声方向,导致优化效率低下。改为预测干净数据x₀,
腾讯混元研究团队探讨了在线大模型强化学习中的批大小调整问题,重点关注生成与训练扩展速度不一致的情况。研究将经典临界批大小理论应用于这一场景,发现对于PPO和GRPO,只要相应调整学习率,就能在有限范围内扩大批大小,同时保留每条响应的学习效果。在固定硬件配置下,扩大批大小使PPO生成吞吐最高提升2.29倍。测试中表现最佳的GRPO配置则以少29%的时间达到相同验证目标。研究为提高在线强化学习训练效率
研究发现,联合多模态扩散 Transformer 存在一种不对称性:音频或 3D 身体动作等伴随模态与视频的对应关系较强,但它们对视频生成的约束作用明显较弱。研究团队提出 RecCAR,即互惠跨模态注意力正则化,通过 KL 正则项,让较弱的“模态到视频”对应关系向较强的“视频到模态”对应关系靠拢。在视频-动作和视频-音频联合生成任务中,人体解剖评分从 0.69 提升至 0.75,音视频不同步程度则
阿里达摩院联合医疗机构研发 DAMO EAGLE,旨在从常规胸部平扫 CT 中识别食管癌及早期、癌前病变,无需内镜或造影剂。发表于《自然·医学》的研究称,该模型已在三个国家的 8 万多例病例中得到验证。在机会性筛查场景中,模型对食管癌的敏感性为 90%,对癌前病变为 52.5%,特异性为 99.2%;在低剂量 CT 上性能未见下降。因此,它有望接入现有肺癌筛查流程。该模型用于筛选需要进一步接受内镜
PackLab 是一个用于开发和评估多模态大语言模型的框架,面向机器人容器装箱中的闭环长期序列决策。该套件包括基于物理的仿真平台,可规模化生成多样化训练轨迹;PackLab-VLM,可根据物体和容器状态的变化同时选择物体并预测放置位置;以及 PackLab-Bench,提供多个难度等级的标准化评测场景。实验显示,在不同物体集合和容器配置下,PackLab-VLM 平均优于传统装箱启发式方法、传统强