Meta称300亿参数的Muse Glimmer“小到”只需一块GPU即可运行
Meta推出了新的AI模型Muse Glimmer。公司表示,该模型拥有300亿个参数,但规模小到可以在单块GPU上运行,用户也能下载并定制这项技术。此外,Meta计划设立10亿美元基金,投资其数据中心附近的美国社区。
AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Meta推出了新的AI模型Muse Glimmer。公司表示,该模型拥有300亿个参数,但规模小到可以在单块GPU上运行,用户也能下载并定制这项技术。此外,Meta计划设立10亿美元基金,投资其数据中心附近的美国社区。
研究人员推出 OneEmo,这是一种用于感知、理解和交互情绪的多模态模型。研究团队构建了 EmoWorld-130K 数据集,通过人工参与流程整理显式推理轨迹;同时提出 Emo-Chord 强化学习方法,以稳定多任务奖励分配。论文实验显示,与规模相近的基线模型相比,OneEmo 在大多数基准测试中达到领先水平。尽管参数量明显少于商业模型,该模型仍取得了具有竞争力的结果。相关代码已在 GitHub
SimWAM是一种面向自动驾驶的世界动作模型,仅在训练阶段使用视频生成。该方法联合训练预训练视频专家模型和轻量级动作专家模型,并通过注意力掩码使轨迹预测不依赖未来视频帧。训练完成后可以移除视频分支,从而得到低延迟的独立规划器。研究人员还使用强化学习优化驾驶奖励,使其超越单纯的轨迹模仿。据论文介绍,SimWAM在NAVSIM上达到91.5 PDMS,超过现有基于世界动作模型的规划器,并可零样本迁移至
基于 LLM 的智能体越来越多地调用外部工具,自主完成多步骤任务,但它们经常获取超出任务所需范围的敏感信息。PrivacyPeek 是一个评估“获取阶段”隐私泄露的基准,关注数据首次进入智能体上下文、尚未出现在回复或外部操作中的阶段。该基准包含 1,182 个案例,覆盖 7 种获取行为和 16 个应用领域。它分析智能体的工具调用轨迹及接收的数据,并测试攻击者能否轻易诱导智能体泄露其已获取但未公开的
Linux 7.2-rc7 已正式发布,内核开发进入最终测试阶段。Linux 创始人 Linus Torvalds 表示,该候选版本体积异常庞大,主要是因为开发者使用 AI 工具生成了大量小型修复,导致整体代码差异规模显著增加。Torvalds 直言对此“并不兴奋”,但认为目前尚可接受,代码中也没有发现令人担忧的问题。本次版本包含 S/390 和 zCrypt 修复、BTRFS 修复工作线程基础设
英伟达发布了 NemotronLabs VoiceChat 11B,这是一款面向实时语音对话的开源端到端模型。不同于传统上将自动语音识别、大语言模型和语音合成串联起来的架构,VoiceChat 11B通过统一网络直接完成流式语音理解与生成。据英伟达介绍,该模型的轮次切换延迟最低可达448毫秒,并支持全双工交互,用户可以在对话过程中插话。模型还支持对话期间调用工具,并通过独立输出通道在处理外部API
研究人员提出了 DualIFM,一种专为视网膜眼底图像设计、从架构层面实现可解释性的基础模型。其 BagNet 主干网络采用小感受野,可生成忠实反映模型决策依据的证据图。预训练阶段加入的二维投影层能够直接可视化表示空间,从而发现具有临床意义的聚类以及潜在的虚假相关。DualIFM 使用超过 80 万张未标注眼底照片进行训练,在参数量仅为 RETFound 十六分之一的情况下,取得了相近的性能,并能
英伟达表示,人工智能的成功不在于组织拥有多少基础设施,而在于能否高效利用这些资源。该公司已将 GPU 访问存储所使用的接口开源,并邀请英特尔协助维护一套旨在将英伟达芯片移出 I/O 路径的软件。这项工作重点是提升人工智能工作负载中的数据传输和存储效率。
一款提出的编译器可将被动采集的屏幕活动转换为用于计算机智能体记忆的确定性活动帧。每个活动帧记录应用、网站、时间、输入量以及指向原始数据的证据指针。由于流程完全不使用模型,输出能够做到字节级一致、可缓存并可机械审计。在包含128,756个活动帧、覆盖51个活跃日的单用户数据集上,该系统在68毫秒内将一天的原始记录压缩为小86倍的可直接用于提示的上下文块。智能体回答当天活动相关问题的准确率达到98.4