开源资讯 实时更新
开源领域最新动态
今日 · 08月10日
19:00
Meta 开源 300 亿参数 AI 模型 Muse Glimmer,24GB 显存 GPU 可运行
Meta 发布了 300 亿参数模型 Muse Glimmer,并采用 Apache 2.0 许可证开源。该模型针对全天候运行的本地智能体工作流优化,使用 4bit 量化,官方称其可在配备 24GB 或 32GB 内存的 Mac 和 PC 上本地运行。Meta 表示,量化对智能体任务性能的影响很小。在搭载 M4 Max、M5 Max 的 MacBook 以及
19:00
利用离线 Top-K Logits 和融合分块 KL 损失提高 LLM 知识蒸馏效率
一项实践研究提出了两种提高大语言模型知识蒸馏效率的系统技术。首先,预先缓存教师模型的 Top-K logits,可在不将教师模型保留于 GPU 内存中的情况下进行训练,同时保持与在线蒸馏几乎相同的训练损失。在单张 H200 GPU 上,每次迭代速度提升约 29%,吞吐量最高提升 41%。其次,融合式分块 KL 损失避免生成覆盖完整词表的 logits 张量,
18:30
Meta发布开放权重模型Muse Glimmer,数周内将推出Muse Spark 1.2开放版本
Meta已发布新的开放权重人工智能模型Muse Glimmer,并计划在未来几周内推出其最先进模型Muse Spark 1.2的开放权重版本。首席执行官马克·扎克伯格希望通过更开放的模型和开发策略,提升外界对Meta人工智能布局的支持。
18:30
扎克伯格批评封闭式 AI 模型,捍卫蒸馏原则
Meta 首席执行官马克·扎克伯格批评封闭式 AI 模型的开发商,尤其是 OpenAI 和 Anthropic。他表示,AI 实验室的讨论过度充斥着末日论调,并为蒸馏作为一项原则进行辩护,认为这有助于让强大的 AI 更广泛地普及。这些言论再次体现了 Meta 支持更开放 AI 发展的立场。
18:30
Meta称300亿参数的Muse Glimmer“小到”只需一块GPU即可运行
Meta推出了新的AI模型Muse Glimmer。公司表示,该模型拥有300亿个参数,但规模小到可以在单块GPU上运行,用户也能下载并定制这项技术。此外,Meta计划设立10亿美元基金,投资其数据中心附近的美国社区。
18:01
OneEmo:统一情绪感知、理解与交互的多模态推理模型
研究人员推出 OneEmo,这是一种用于感知、理解和交互情绪的多模态模型。研究团队构建了 EmoWorld-130K 数据集,通过人工参与流程整理显式推理轨迹;同时提出 Emo-Chord 强化学习方法,以稳定多任务奖励分配。论文实验显示,与规模相近的基线模型相比,OneEmo 在大多数基准测试中达到领先水平。尽管参数量明显少于商业模型,该模型仍取得了具有竞
11:31
SimWAM:面向端到端自动驾驶的简易世界动作模型
SimWAM是一种面向自动驾驶的世界动作模型,仅在训练阶段使用视频生成。该方法联合训练预训练视频专家模型和轻量级动作专家模型,并通过注意力掩码使轨迹预测不依赖未来视频帧。训练完成后可以移除视频分支,从而得到低延迟的独立规划器。研究人员还使用强化学习优化驾驶奖励,使其超越单纯的轨迹模仿。据论文介绍,SimWAM在NAVSIM上达到91.5 PDMS,超过现有基
13:00
PrivacyPeek 审计 LLM 智能体获取了什么,而不只是它们说了什么
基于 LLM 的智能体越来越多地调用外部工具,自主完成多步骤任务,但它们经常获取超出任务所需范围的敏感信息。PrivacyPeek 是一个评估“获取阶段”隐私泄露的基准,关注数据首次进入智能体上下文、尚未出现在回复或外部操作中的阶段。该基准包含 1,182 个案例,覆盖 7 种获取行为和 16 个应用领域。它分析智能体的工具调用轨迹及接收的数据,并测试攻击者
14:01
AI 工具导致 Linux 7.2 候选版体积异常膨胀
Linux 7.2-rc7 已正式发布,内核开发进入最终测试阶段。Linux 创始人 Linus Torvalds 表示,该候选版本体积异常庞大,主要是因为开发者使用 AI 工具生成了大量小型修复,导致整体代码差异规模显著增加。Torvalds 直言对此“并不兴奋”,但认为目前尚可接受,代码中也没有发现令人担忧的问题。本次版本包含 S/390 和 zCryp
16:01
英伟达发布首款开源全双工语音模型 VoiceChat 11B
英伟达发布了 NemotronLabs VoiceChat 11B,这是一款面向实时语音对话的开源端到端模型。不同于传统上将自动语音识别、大语言模型和语音合成串联起来的架构,VoiceChat 11B通过统一网络直接完成流式语音理解与生成。据英伟达介绍,该模型的轮次切换延迟最低可达448毫秒,并支持全双工交互,用户可以在对话过程中插话。模型还支持对话期间调用
16:30
面向视网膜眼底图像的可解释基础模型 DualIFM
研究人员提出了 DualIFM,一种专为视网膜眼底图像设计、从架构层面实现可解释性的基础模型。其 BagNet 主干网络采用小感受野,可生成忠实反映模型决策依据的证据图。预训练阶段加入的二维投影层能够直接可视化表示空间,从而发现具有临床意义的聚类以及潜在的虚假相关。DualIFM 使用超过 80 万张未标注眼底照片进行训练,在参数量仅为 RETFound 十