开源资讯 实时更新

开源领域最新动态

今日 · 08月10日
19:00

Meta 开源 300 亿参数 AI 模型 Muse Glimmer,24GB 显存 GPU 可运行

Meta 发布了 300 亿参数模型 Muse Glimmer,并采用 Apache 2.0 许可证开源。该模型针对全天候运行的本地智能体工作流优化,使用 4bit 量化,官方称其可在配备 24GB 或 32GB 内存的 Mac 和 PC 上本地运行。Meta 表示,量化对智能体任务性能的影响很小。在搭载 M4 Max、M5 Max 的 MacBook 以及
19:00

利用离线 Top-K Logits 和融合分块 KL 损失提高 LLM 知识蒸馏效率

一项实践研究提出了两种提高大语言模型知识蒸馏效率的系统技术。首先,预先缓存教师模型的 Top-K logits,可在不将教师模型保留于 GPU 内存中的情况下进行训练,同时保持与在线蒸馏几乎相同的训练损失。在单张 H200 GPU 上,每次迭代速度提升约 29%,吞吐量最高提升 41%。其次,融合式分块 KL 损失避免生成覆盖完整词表的 logits 张量,
行业资讯 AI模型 研究 开源 来源:Hugging Face 962
18:30

Meta发布开放权重模型Muse Glimmer,数周内将推出Muse Spark 1.2开放版本

Meta已发布新的开放权重人工智能模型Muse Glimmer,并计划在未来几周内推出其最先进模型Muse Spark 1.2的开放权重版本。首席执行官马克·扎克伯格希望通过更开放的模型和开发策略,提升外界对Meta人工智能布局的支持。
18:30

扎克伯格批评封闭式 AI 模型,捍卫蒸馏原则

Meta 首席执行官马克·扎克伯格批评封闭式 AI 模型的开发商,尤其是 OpenAI 和 Anthropic。他表示,AI 实验室的讨论过度充斥着末日论调,并为蒸馏作为一项原则进行辩护,认为这有助于让强大的 AI 更广泛地普及。这些言论再次体现了 Meta 支持更开放 AI 发展的立场。
18:30

Meta称300亿参数的Muse Glimmer“小到”只需一块GPU即可运行

Meta推出了新的AI模型Muse Glimmer。公司表示,该模型拥有300亿个参数,但规模小到可以在单块GPU上运行,用户也能下载并定制这项技术。此外,Meta计划设立10亿美元基金,投资其数据中心附近的美国社区。
18:01

OneEmo:统一情绪感知、理解与交互的多模态推理模型

研究人员推出 OneEmo,这是一种用于感知、理解和交互情绪的多模态模型。研究团队构建了 EmoWorld-130K 数据集,通过人工参与流程整理显式推理轨迹;同时提出 Emo-Chord 强化学习方法,以稳定多任务奖励分配。论文实验显示,与规模相近的基线模型相比,OneEmo 在大多数基准测试中达到领先水平。尽管参数量明显少于商业模型,该模型仍取得了具有竞
行业资讯 应用 AI模型 研究 开源 来源:Hugging Face 990
11:31

SimWAM:面向端到端自动驾驶的简易世界动作模型

SimWAM是一种面向自动驾驶的世界动作模型,仅在训练阶段使用视频生成。该方法联合训练预训练视频专家模型和轻量级动作专家模型,并通过注意力掩码使轨迹预测不依赖未来视频帧。训练完成后可以移除视频分支,从而得到低延迟的独立规划器。研究人员还使用强化学习优化驾驶奖励,使其超越单纯的轨迹模仿。据论文介绍,SimWAM在NAVSIM上达到91.5 PDMS,超过现有基
行业资讯 应用 研究 开源 来源:Hugging Face 140
13:00

PrivacyPeek 审计 LLM 智能体获取了什么,而不只是它们说了什么

基于 LLM 的智能体越来越多地调用外部工具,自主完成多步骤任务,但它们经常获取超出任务所需范围的敏感信息。PrivacyPeek 是一个评估“获取阶段”隐私泄露的基准,关注数据首次进入智能体上下文、尚未出现在回复或外部操作中的阶段。该基准包含 1,182 个案例,覆盖 7 种获取行为和 16 个应用领域。它分析智能体的工具调用轨迹及接收的数据,并测试攻击者
行业资讯 伦理与安全 研究 开源 来源:Hugging Face 968
14:01

AI 工具导致 Linux 7.2 候选版体积异常膨胀

Linux 7.2-rc7 已正式发布,内核开发进入最终测试阶段。Linux 创始人 Linus Torvalds 表示,该候选版本体积异常庞大,主要是因为开发者使用 AI 工具生成了大量小型修复,导致整体代码差异规模显著增加。Torvalds 直言对此“并不兴奋”,但认为目前尚可接受,代码中也没有发现令人担忧的问题。本次版本包含 S/390 和 zCryp
行业资讯 应用 行业新闻 开源 来源:AIbase 443
16:01

英伟达发布首款开源全双工语音模型 VoiceChat 11B

英伟达发布了 NemotronLabs VoiceChat 11B,这是一款面向实时语音对话的开源端到端模型。不同于传统上将自动语音识别、大语言模型和语音合成串联起来的架构,VoiceChat 11B通过统一网络直接完成流式语音理解与生成。据英伟达介绍,该模型的轮次切换延迟最低可达448毫秒,并支持全双工交互,用户可以在对话过程中插话。模型还支持对话期间调用
16:30

面向视网膜眼底图像的可解释基础模型 DualIFM

研究人员提出了 DualIFM,一种专为视网膜眼底图像设计、从架构层面实现可解释性的基础模型。其 BagNet 主干网络采用小感受野,可生成忠实反映模型决策依据的证据图。预训练阶段加入的二维投影层能够直接可视化表示空间,从而发现具有临床意义的聚类以及潜在的虚假相关。DualIFM 使用超过 80 万张未标注眼底照片进行训练,在参数量仅为 RETFound 十
行业资讯 应用 AI模型 研究 开源 来源:Hugging Face 282