AI 新闻中心

AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

腾讯混元 Hy4 Preview 完成优化并全面上线,任务轮次与 Token 消耗显著降低

腾讯混元与 WorkBuddy 联合团队于 9 月 7 日宣布,混元 Hy4 Preview 升级版已全面上线。针对用户和开发者反馈的复杂任务思考时间过长、过度自我验证等问题,团队进行了专项优化。通过 Bench 指标与人工评测双重验证,结果显示模型在保持任务效果的同时,显著减少了任务轮次以及输入、输出 Token 消耗。此次更新有望提升 Agent 应用中的响应效率,并降低模型调用成本。

AI大模型周榜:中国多模型密集进入前端开发前列,阿里Wan3.0跻身视频榜前三

Arena发布2026年第36周AI大模型盲测排名,榜单依据匿名盲测投票并通过ELO计算。多款中国模型在专业细分领域取得进展:阿里Qwen3.8-Max-0902首次进入前端开发榜即排名第四,视频生成模型Wan3.0首度上榜便位列第三。阿里、腾讯和智谱的其他新模型也进入多个榜单前列。综合榜仍由海外模型主导,但头部模型之间的分差较小。需要注意的是,Arena排名反映用户主观偏好,并非绝对能力测试;各

音视频模型中的注意力三角

该研究分析音视频扩散模型如何通过三条跨模态注意力路径协调文本、声音和视觉内容。研究发现,音频与视频之间的路径具有双向作用:音频可以影响视频生成,视频也可以影响音频生成。模型参数中学习到的偏差可能使这些交互覆盖原本的条件输入,从而生成视觉上典型但语义错误的结果。研究人员从注意力模式中提取信号,用于诊断语义如何在不同模态之间分布,并在推理阶段实施受控干预。实验表明,该方法能够改善跨模态语义对齐,同时基

数学里程碑:Claude 用 11 天完成费马大定理的形式化证明

Anthropic 表示,一个 Claude 模型经过约 11 天大致自主运行,首次在 Lean 中完成了费马大定理的端到端形式化,并通过计算机检查。该模型并未重新发现新的数学证明,而是将安德鲁·怀尔斯已有的证明转换为 Lean 证明助手能够逐步验证的形式。Claude 生成约 1300 万行 Lean 代码,证明了约 3.03 万个定理,其中近 2.95 万个被纳入最终证明。多个 Claude

中国大模型调用量连续19周全球领先,腾讯混元Hy4 Preview单周增长379%

根据 OpenRouter 最新数据测算,8月31日至9月6日,全球主要大模型总调用量达到115万亿Token,环比增长1.77%。中国大模型调用量为56.72万亿Token,美国大模型为16.54万亿Token,中国模型连续19周领先。调用量前五名中有四款来自中国。腾讯混元 Hy4 Preview 以14.7万亿Token位居第一,环比增长379%。该模型于8月28日开源,拥有7700亿总参数、

OpenAI宣布“自动化研究实习生”里程碑:内部智能体运行时长达人工的3.1倍

OpenAI表示,其内部系统已达到“自动化研究实习生”里程碑。在人类监督和指导下,该系统能够完成资深研究人员通常需要数天处理的、定义明确的复杂任务。截至8月中旬,OpenAI核心研究组织中,每投入一个人类工作日,智能体的运行时间相当于3.1个智能体工作日。不过,这一比例衡量的是运行时间和工作量,并不等同于相同的生产力或实际产出。OpenAI员工Kevin Liu认为,递归式自我改进可能成为未来几年

火山引擎内测AI版权平台,Seedance转向IP商业化

据《娱乐资本论》报道,字节跳动旗下火山引擎近日邀请多家版权方参与AI版权管理平台内测。品牌方和短剧制作方可调用Seedance、Seedream等模型,使用已获授权的正版IP进行创作;版权方则可在后台完成监修、审核和交易管理。平台预计于今年下半年正式上线,提供面向消费者的模板创作和面向企业客户的自由创作两种授权方式。目前据称已有数十个头部IP签约,包括周星驰旗下比高集团相关影视作品。部分企业项目报

科大讯飞发布星火 X2.5:293B-A30B MoE 模型,完全基于国产平台训练

科大讯飞正式发布多语言文本生成模型星火 Spark X2.5。该 MoE 模型总参数量为 2930 亿,推理时最多激活 300 亿参数,支持 256K 上下文。科大讯飞表示,该模型完全基于中国自主研发的平台训练,并提升了代码生成和智能体能力。模型支持 200 多种语言,可用于语言理解、问答和推理等通用任务。Spark X2.5 已上线科大讯飞星辰 MaaS 平台,价格为输入每百万 Token 1.

微信视觉团队开源多模态嵌入模型 WeMM-Embedding

腾讯微信视觉团队开源了通用多模态嵌入模型 WeMM-Embedding,支持文本、图像等输入。该模型提供 2B、4B 和 9B 三种规模,面向不同部署需求。其采用统一架构,并结合两阶段训练与知识蒸馏,在多模态理解能力和部署效率之间进行平衡。据腾讯介绍,WeMM-Embedding 已大规模部署于微信推荐与搜索系统,日调用量达到十亿级。此次开源使开发者能够使用一款已在大型商业服务中部署的模型,但公告

算力竞赛背后:OpenAI据称为“Astra”投入数百亿美元,中国大模型的基础设施差距在哪里?

文章称,OpenAI通过Stargate计划,使用超过10万张英伟达GPU训练所谓的“Astra”模型。若计入服务器、网络、电力、散热和研发成本,相关基础设施投资可能达到100亿至250亿美元,这一数字来自媒体引用的估算。相比之下,DeepSeek计划在中国建设的数据中心据称将采购16万张华为AI芯片,投资约25.6亿美元。不过,Astra的存在、具体规格和相关支出目前均未得到公开证实。文章指出,

当量化破坏记忆:低精度时序推理中的循环状态回写

一项研究表明,在循环神经网络中,状态被写回和保存的方式可能决定低精度推理的准确率。在用于荧光寿命成像的 GRU 编码器—解码器中,采用确定性的 4 位状态存储后,短寿命成分 τ1 和长寿命成分 τ2 的估计误差分别增加约 70 倍和 300 倍。原因是反复出现的小幅更新低于写入阈值,未能反映到存储状态中。误差反馈、残差记忆和方向记忆能够在无需重新训练的情况下恢复准确率。对独立训练的 LSTM 进行

当模型修改过多:评估最小代码修改的忠实度

一项研究分析了大型语言模型在修复漏洞时为何经常修改超出必要范围的代码。研究人员使用 BigCodeBench 的 400 个问题,注入受控的 AST 级错误,以衡量修复结果是否接近最小补丁。即使是 GPT-5.5 等强大模型,也经常产生不必要的大幅修改并增加认知复杂度。加入保留原有代码的指令后,过度 Levenshtein 距离从 0.195 降至 0.131,新增认知复杂度降低 26.6%,Pa

RISE:通过自我外推策略蒸馏实现递归改进

RISE 是一种语言模型后训练方法,可直接从模型自身的 RLVR 训练轨迹中构建合成教师模型。该方法在参数空间或输出 logit 空间中外推当前检查点与较早锚点之间的变化,从而生成密集的逐 token 监督信号,无需外部模型或特权条件信息。基于结果的奖励将外推引向正确推理,而蒸馏则改进逐 token 的决策。随着学生模型不断进步,教师模型也会持续更新,使蒸馏从一次性压缩步骤转变为递归改进机制。在数

未经证实的说法:Claude据称在黎曼猜想上取得进展

文章声称,Anthropic旗下模型Claude证明了ζ函数的67.25%零点位于临界线上,且为单零点。文章还称,数学家Youness Lamzouri利用希尔伯特空间不等式简化了相关方法,AxiomProver则在发布后不久通过Lean完成了形式化验证。此外,文中还宣称孪生素数猜想取得进展。上述叙述高度煽情,未提供可核实的来源或独立确认。黎曼猜想目前仍是未解决问题,所谓完整的机器验证也应接受严格

Iris:迈向搜索前沿

研究团队推出 Iris-mini 和 Iris-pro 两个搜索代理,分别以 35B-A3B 和 397B-A17B 规模训练。其训练任务根据网页语料中的多跳超链接结构生成,并专门设计为无法通过简单的字符串匹配解决。研究采用监督微调与强化学习相结合的方法,优化代理的实时搜索和上下文管理能力。启用上下文管理后,作者称两款模型在 BrowseComp、BrowseComp-ZH、DeepSearchQ