AI 新闻中心

AI 新闻中心 过去一年分析了 1725 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

扎克伯格押注本地智能:Meta 开源 300 亿参数稠密模型 Muse Glimmer

Meta 发布了 Muse Glimmer,这是 Llama 4 推出以来该公司首次向公众开放模型权重。该模型拥有 300 亿参数,采用 Apache 2.0 许可证,是一款针对本地和常驻运行智能体工作流优化的多模态模型,支持文本与视觉处理、多步推理和工具调用。通过约 4 bit 量化,模型体积可压缩至 20GB 以下,据称能够在配备 24GB 或 32GB 显存的消费级 PC 或 Mac 上运行

Claude未能攻克黎曼猜想,却据称刷新百年数学问题的下界

据报道,Anthropic尚未公开的研究版Claude在探索黎曼猜想时,将黎曼ζ函数临界线上零点比例的已知下界从41.6%提高到67.2%。这并不意味着黎曼猜想已有67.2%得到证明。报道称,Claude协调了约60个子代理,进行文献检索、经典方法重组和结果验证。不过,这一说法尚未得到正式发表论文或独立研究的确认,因此其对未来科研流程的实际影响仍不确定。

消息称三星加快自研人形机器人开发

据韩国媒体报道,三星电子正整合全公司资源,加快人形机器人研发。除了子公司 Rainbow Robotics 外,三星电子也在独立开发自有机型。三星可能利用家电、移动设备、半导体和显示面板业务积累的制造数据,并结合自研 AI 模型 Samsung Gauss 及正在开发的世界模型。公司据称还在开发自有执行器,并借鉴长期积累的家电电机技术。新成立的 Robotics eXperience 组织将统筹战

将视觉语言落地建模为双向概念对应

一项新研究将视觉语言落地定义为视觉指涉文本片段与图像中实例级区域之间的双向对应。与传统方法不同,该方法不假设相关文本片段已经被预先标注。研究提出的 ConCor-1 模型利用可学习的桥接标记,预测文本掩码、图像掩码以及对应关系是否存在。研究人员还将多个落地和分割数据集转换为统一的对应格式。在实验中,ConCor-1 在长描述数据集上的对应 F1 指标较基线提升 48%;在以大型类别列表作为文本输入

研究人员发现可从专有 LLM API 窃取推理轨迹的漏洞

一项研究发现,主要 LLM 提供商在客户端处理加密思维链数据时存在架构漏洞。这些加密区块似乎可以在同一提供商的不同会话、用户和模型之间互换。攻击者可将更强模型生成的推理轨迹注入较弱且防护较少的模型,迫使后者解码并以明文输出隐藏推理。研究人员已在 Anthropic、OpenAI 和 Google 的系统中验证这一方法。他们分析了从公开代码库获取的 315,320 个推理区块,找出 367 条个人身

Gemini 3.5 Pro迟迟未发布,谷歌或直接转向Gemini 4

据行业分析机构SemiAnalysis最新报告,谷歌可能已暂缓原定的Gemini 3.5 Pro发布计划,并提前宣传Gemini 4系列。谷歌此前曾表示该模型预计于2026年6月推出,但目前仍未正式上线。据报道,模型在部分关键能力上仍需改进,尤其是代码生成。Gemini 3.5 Pro曾短暂出现在Arena平台,约30分钟后被移除,引发外界对其测试状态的猜测。谷歌表示,该模型仍在与合作伙伴进行评估

谷歌 Gemini 3.7 Flash 模型踪迹曝光,距 3.6 Flash 发布不到一个月

科技媒体 TestingCatalog 称,在谷歌 Python GenAI SDK 的 GitHub 仓库中发现了可能与 Gemini 3.7 Flash 有关的模型名称。据报道,谷歌内部曾尝试将该模型加入 SDK,并通过 Copybara 同步至公开仓库,但因命名错误被拒绝。谷歌官方 API 更新日志和模型目录目前仍以 7 月 21 日发布的 Gemini 3.6 Flash 为主。Gemin

微软发布 MAI-Image-2.6,跃升 Arena 文生图排行榜第二位

微软发布了新一代自研文生图模型 MAI-Image-2.6。根据 Arena 排行榜,该模型以 1336 分 Elo 位列第二,仅次于 OpenAI 的 GPT Image 2(Medium)。相比 2.5 版本,其整体 Elo 评分提升 79 分,文本渲染能力提升 91 分。模型在 3D 成像、商业设计、艺术,以及卡通、动漫和幻想类别中的表现均有所提升。它支持融合多张参考图像,并提供对推理、输出

OpenAI 神秘图像模型现身 Arena,疑似 GPT Image 2.5 的衍生版本

一款代号为“mona-lisa-1”的新 OpenAI 图像模型据称悄然出现在 Arena。用户发现其带有 SynthID 水印,因此判断模型来自 OpenAI。初步测试显示,该模型的画面真实感有所提升,过去较明显的“塑料感”减弱,细节表现也更加丰富,在艺术作品和复杂信息图生成方面尤其突出。开发者推测它可能与 GPT Image 2 使用同代基础模型,并可能是 GPT Image 2.5 的中间检

消息称谷歌已暂缓发布 Gemini 3.5 Pro

行业分析机构 Semi Analysis 的最新报告称,谷歌可能已推迟 Gemini 3.5 Pro 的发布。首席执行官桑达尔·皮查伊此前表示该模型将于 6 月推出,但目前仍未正式上线。据报道,Gemini 3.5 Pro 曾短暂出现在 Arena 平台上,约 30 分钟后被移除。Semi Analysis 指出,Gemini 目前落后于多个领先的前沿模型。

ZCode升级GLM编程流程,新增自主交付能力

智谱AI旗下、针对GLM系列优化的编程调度框架ZCode,推出Goal模式、子智能体、远程控制和闲时任务四项功能。Goal模式允许开发者设定可验收目标,由系统自动拆解任务、修改代码、运行测试并持续迭代。子智能体支持开发和调试任务并行执行;远程控制则可通过微信、飞书访问桌面工作区,代码仍在本地、SSH、WSL或Docker环境中运行。智谱称,在使用GLM-5.2的内部Z.ai Code Bench测

具备内在可解释性的语言模型可随规模扩展

一项新研究将可解释性作为训练流程中的约束,而不是在模型完成后再进行分析。研究人员在三个数量级的计算规模上,对自回归和扩散式语言模型进行了实验,结果表明,可解释性可能与模型能力同步提升。研究中的扩散式模型 Steerling-8B 能将生成的词元归因于相关输入词元、人类可理解的概念以及训练数据。这使系统能够诊断输出、检索相似训练数据,并通过概念引导修正模型行为,无需重新训练。研究称,Steerlin

Agent Memory Distillation 通过分层教师记忆增强小型大语言模型智能体

Agent Memory Distillation(AMD)是一种无需训练的框架,通过分层记忆将大型教师智能体的结构化知识传递给小型语言模型。工作流记忆编码任务级策略,子任务记忆提供具体行为示例,函数记忆则记录函数调用规范和常见错误。在三个工具使用基准测试中,研究使用 GPT-5-mini 作为教师,评估了四个参数规模为 4B 至 8B 的学生模型。AMD 使平均准确率分别提升 27.2、11.2

RynnValue:利用时间距离扩展机器人价值基础模型

RynnValue 是一个面向机器人操作的开源价值基础模型。它不依赖偏好或进度标注,而是使用时间距离,即从观测结果到语言指定目标的有向代价。这使模型能够利用超过 7,000 小时数据和约 300 万个指令条件视频片段进行训练。在 RBM-EVAL-OOD 基准测试中,RynnValue 的 Kendall tau_a 达到 0.675,超过完全使用偏好监督的方法(0.655)。将其转换为密集奖励后

消息称 Anthropic 最快将于9月上市,并淡化AI模型竞争等挑战

据《华尔街日报》报道,Anthropic正与潜在投资者接触,计划最早于9月或10月初进行首次公开募股。公司重点强调快速增长势头和编程工具Claude Code的成功,但投资者正关注中国低价AI系统的竞争、与特朗普政府的紧张关系,以及美国各地反对建设数据中心的声音。据知情人士透露,Anthropic高管淡化了中国AI企业的竞争影响,称多数用户仍希望使用能力最强的模型。公司还计划拓展AI在医疗和生物学