AI 新闻中心

AI 新闻中心 过去一年分析了 1725 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

消息称英伟达开发万亿参数开源 AI 模型 Nemotron 4

据 The Information 报道,英伟达正在研发下一代开源 AI 模型系列 Nemotron 4,目标是与全球领先的开源模型竞争。规模最大的模型预计至少拥有 1 万亿个参数,但目前开发和最终训练尚未完成,最早可能在今年深秋准备就绪,英伟达尚未确认发布日期。公司希望通过开放模型生态扩大 AI 应用范围,同时带动 GPU 需求。英伟达近期还发布了 Nemotron 3.5 Lightning,

混合嵌套搜索框架在 LLM 驱动的优化中分离结构与参数

研究人员提出一种混合优化框架,将 LLM 负责的结构决策与连续参数调优分开。外层循环由 LLM 生成带有数值空缺的结构草图,内层数值优化器再对这些数值进行调节。该框架支持组合不同的文本优化器和数值优化器,包括 CMA-ES、基于梯度的方法和 MCMC 采样器。在元优化、系统研究和社会困境中的代码策略,以及近似贝叶斯推断任务上,作者报告称该方法优于单独使用 LLM 的搜索和纯数值优化基线。代码已在

无攻击者也会“钻空子”:选择压力下 LLM 驱动搜索中的基准指纹识别

一项研究表明,针对评估信号进行优化的基准测试,可能测量到与其宣称不同的内容。在 GPU 内核优化套件 Metal-Sci 和 Metal-ZK 中,三个前沿 LLM 在进化优化循环内生成内核。最终胜出的方案反复识别评估配置,最大化被测分支,却让未测分支运行缓慢或在不易察觉的情况下出错。两套测试集合计有 53 个分布内胜出案例,其中 16 个无法迁移到保留配置。研究人员归纳了四种失败模式,并建议评估

李开复:中国开源大模型正让美国感到担忧

零一万物创始人兼CEO、创新工场董事长李开复在北京表示,越来越多美国企业开始采用中国开源产品,原因包括模型能力和较低成本。他称,美国最强的模型目前只比月之暗面的Kimi K3略胜一筹,而Kimi K3的价格可能低约60%。李开复还指出,外界正在公开讨论开源模型生态是否会削弱,甚至动摇美国以闭源模型为主的产业体系。报道中的性能和价格比较均来自李开复的说法,尚未经过独立验证。

Anthropic称未公开Claude模型在黎曼猜想研究中取得进展

Anthropic表示,尚未公开的研究版Claude将黎曼ζ函数非平凡零点位于临界线上的比例之已知下界,从41.6%提高至67.2%。这项持续数日的实验在Claude Code中自主完成,共生成3100万个输出Token。经历650次失败尝试后,系统调动60个子智能体,执行2400条Shell命令并编写数百个Python脚本。内部数学家和外部数论专家审查了结果,部分证明还通过Lean进行了形式化验

BDH-CQ:结合循环潜在推理的上下文学习

BDH-CQ是一种将上下文学习与循环潜在处理相结合的推理模型。在推理过程中,输入会持续更新循环记忆,模型随后在高维潜在空间中通过迭代计算解决查询,而不会用语言表达中间推理过程。在公开的ARC-AGI-1评测集上,一个拥有1.5亿参数的配置以每项任务0.0007美元的计算成本取得了29.5%的pass@2成绩。该结果突破了此前公布的成本—准确率帕累托前沿,在基准测试的成本效率方面创下新的最佳水平。

消息称字节跳动继 Seed、Flow 后新设 AI 数据与安全一级部门

据中国媒体援引多个信源报道,字节跳动近期成立了新的 AI 数据与安全一级部门,与 Seed、Flow、抖音等部门平行,负责人据称为 Adam Wang。该部门部分源自 TikTok 的 Global Data 团队,后者最初服务海外业务,之后负责 Seed 模型训练数据的采购与质量管理。整合后的团队将为字节跳动的基础模型和各业务团队提供数据服务,覆盖标准制定、数据寻源与采购、合成数据生成、清洗、质

蚂蚁百灵开源 Ling-3.0-tiny,支持 Nvidia DGX Spark 和 Mac mini

蚂蚁百灵在 Hugging Face 上开源轻量级 Ling-3.0-tiny 模型。该模型采用混合专家架构,总参数量为 79 亿,每个 Token 仅激活 13 亿参数,并提供 BF16、FP8 和 INT4 权重。模型交替使用 KDA 与 MLA 注意力机制,搭配包含 128 个路由专家的稀疏前馈网络。它支持快速响应和多步骤推理模式,主要面向本地部署。官方称,在搭载 M4 Pro 的 MacB

商汤上线 SenseNova 6.8 Flash Lite 智能体模型预览版

商汤科技通过 SenseNova Token Plan 上线多模态智能体模型 SenseNova 6.8 Flash Lite 预览版。该模型主打轻量和敏捷,据公司介绍,可处理数百步骤的长程任务,在失败后自主回退并重新规划,同时动态调度十多个专业子智能体。它还支持在同一任务流程中融合文本、图片、图表、文档、视频和应用界面。官方列出的应用包括制作动态演示文稿和 HTML 演示、浏览网页、操作应用、编