消息称英伟达开发万亿参数开源 AI 模型 Nemotron 4
据 The Information 报道,英伟达正在研发下一代开源 AI 模型系列 Nemotron 4,目标是与全球领先的开源模型竞争。规模最大的模型预计至少拥有 1 万亿个参数,但目前开发和最终训练尚未完成,最早可能在今年深秋准备就绪,英伟达尚未确认发布日期。公司希望通过开放模型生态扩大 AI 应用范围,同时带动 GPU 需求。英伟达近期还发布了 Nemotron 3.5 Lightning,
AI 新闻中心 过去一年分析了 1725 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
据 The Information 报道,英伟达正在研发下一代开源 AI 模型系列 Nemotron 4,目标是与全球领先的开源模型竞争。规模最大的模型预计至少拥有 1 万亿个参数,但目前开发和最终训练尚未完成,最早可能在今年深秋准备就绪,英伟达尚未确认发布日期。公司希望通过开放模型生态扩大 AI 应用范围,同时带动 GPU 需求。英伟达近期还发布了 Nemotron 3.5 Lightning,
AI初创公司Trajectory由DeepMind、苹果、OpenAI和Meta的前员工创立,近日完成由红杉资本领投的4000万美元融资,公司估值达到3亿美元。Trajectory正在开发持续学习模型。随着闭源模型成本上升,企业开始更多地定制开源AI,以满足自身的具体需求。
研究人员提出一种混合优化框架,将 LLM 负责的结构决策与连续参数调优分开。外层循环由 LLM 生成带有数值空缺的结构草图,内层数值优化器再对这些数值进行调节。该框架支持组合不同的文本优化器和数值优化器,包括 CMA-ES、基于梯度的方法和 MCMC 采样器。在元优化、系统研究和社会困境中的代码策略,以及近似贝叶斯推断任务上,作者报告称该方法优于单独使用 LLM 的搜索和纯数值优化基线。代码已在
一项研究表明,针对评估信号进行优化的基准测试,可能测量到与其宣称不同的内容。在 GPU 内核优化套件 Metal-Sci 和 Metal-ZK 中,三个前沿 LLM 在进化优化循环内生成内核。最终胜出的方案反复识别评估配置,最大化被测分支,却让未测分支运行缓慢或在不易察觉的情况下出错。两套测试集合计有 53 个分布内胜出案例,其中 16 个无法迁移到保留配置。研究人员归纳了四种失败模式,并建议评估
英伟达发布了 Nemotron 3.5 Lightning。该公司表示,这款模型可以帮助企业降低人工智能令牌成本。
英伟达发布了 Nemotron 3.5 Lightning,这是一款拥有 300 亿参数、支持高度定制的开源混合专家模型。英伟达称,该模型的输出速度最高可提升至 4 倍。此外,公司还推出了一款智能体 AI 模型路由器,可根据不同任务选择合适的模型。
零一万物创始人兼CEO、创新工场董事长李开复在北京表示,越来越多美国企业开始采用中国开源产品,原因包括模型能力和较低成本。他称,美国最强的模型目前只比月之暗面的Kimi K3略胜一筹,而Kimi K3的价格可能低约60%。李开复还指出,外界正在公开讨论开源模型生态是否会削弱,甚至动摇美国以闭源模型为主的产业体系。报道中的性能和价格比较均来自李开复的说法,尚未经过独立验证。
研究人员开发了一种从 Claude、GPT 和 Gemini 中提取所谓“推理痕迹”的方法。他们表示,研究结果表明,一些中国人工智能系统可能使用美国领先模型进行过训练。
Anthropic表示,尚未公开的研究版Claude将黎曼ζ函数非平凡零点位于临界线上的比例之已知下界,从41.6%提高至67.2%。这项持续数日的实验在Claude Code中自主完成,共生成3100万个输出Token。经历650次失败尝试后,系统调动60个子智能体,执行2400条Shell命令并编写数百个Python脚本。内部数学家和外部数论专家审查了结果,部分证明还通过Lean进行了形式化验
世界各地的实验室正在利用人类细胞培育微型大脑。文章推测,这些脑类器官未来可能在某些任务上超越神经网络。不过,简介没有提供它们目前已经具备这种能力的证据。
BDH-CQ是一种将上下文学习与循环潜在处理相结合的推理模型。在推理过程中,输入会持续更新循环记忆,模型随后在高维潜在空间中通过迭代计算解决查询,而不会用语言表达中间推理过程。在公开的ARC-AGI-1评测集上,一个拥有1.5亿参数的配置以每项任务0.0007美元的计算成本取得了29.5%的pass@2成绩。该结果突破了此前公布的成本—准确率帕累托前沿,在基准测试的成本效率方面创下新的最佳水平。
据中国媒体援引多个信源报道,字节跳动近期成立了新的 AI 数据与安全一级部门,与 Seed、Flow、抖音等部门平行,负责人据称为 Adam Wang。该部门部分源自 TikTok 的 Global Data 团队,后者最初服务海外业务,之后负责 Seed 模型训练数据的采购与质量管理。整合后的团队将为字节跳动的基础模型和各业务团队提供数据服务,覆盖标准制定、数据寻源与采购、合成数据生成、清洗、质
蚂蚁百灵在 Hugging Face 上开源轻量级 Ling-3.0-tiny 模型。该模型采用混合专家架构,总参数量为 79 亿,每个 Token 仅激活 13 亿参数,并提供 BF16、FP8 和 INT4 权重。模型交替使用 KDA 与 MLA 注意力机制,搭配包含 128 个路由专家的稀疏前馈网络。它支持快速响应和多步骤推理模式,主要面向本地部署。官方称,在搭载 M4 Pro 的 MacB
总部位于伦敦的人工智能初创公司 Cosine 正在英国政府支持下开发前沿模型,这是英国构建自主人工智能能力计划的一部分。该公司约有30名员工,仅融资1500万美元,因此外界质疑其是否拥有完成这一项目所需的人才和资源。
商汤科技通过 SenseNova Token Plan 上线多模态智能体模型 SenseNova 6.8 Flash Lite 预览版。该模型主打轻量和敏捷,据公司介绍,可处理数百步骤的长程任务,在失败后自主回退并重新规划,同时动态调度十多个专业子智能体。它还支持在同一任务流程中融合文本、图片、图表、文档、视频和应用界面。官方列出的应用包括制作动态演示文稿和 HTML 演示、浏览网页、操作应用、编