AI 新闻中心

AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

智谱完成约50亿美元融资,将投入下一代GLM基础模型研发

中国人工智能公司智谱宣布完成约50亿美元融资,其中约20亿美元来自股份配售,约30亿美元来自可转债发行。资金将主要用于下一代GLM基础模型、完全自训练体系、大规模训练与生产推理,以及算力资源和技术基础设施的建设与升级。智谱表示,完全自训练是让下一代GLM在上一代模型构建的环境中训练,形成递归式自我改进循环。相关投入还包括自动生成和筛选训练数据、构建任务环境、提升长程推理能力,以及进行国产芯片适配、

人工智能如何为拥挤的无线电波开辟频谱空间

动态频谱共享有望让更多设备和服务共同使用有限的无线电频率。要实现这一目标,需要比过去固定频率设备更加灵活的无线电系统。每次打电话、播放视频或连接 Wi-Fi,设备都会通过空气传输和接收不可见的信号。婴儿监视器、车库门开关、GPS、气象卫星,以及帮助飞机保持安全间隔的雷达,也都依赖同一种资源:无线电频谱。

中国发布首个国产 GPU 与类脑芯片大模型异构推理系统

2026中国算力大会上,国产GPU与类脑芯片大模型异构混合推理系统正式发布。该系统由移动云联合中国电子科技南湖研究院、相关芯片企业及清华大学、北京大学等共同研发。官方称,在DeepSeek V4实测中,系统相比同类国产GPU算力集群性价比提升一倍以上,业务运营成本降低40%以上。系统采用任务拆分架构,由国产GPU负责Attention计算,由类脑芯片处理对时延敏感的FFN和MoE模块。自研模型编译

CARDEA:基于空间证据的可审计推理,实现冠状动脉造影端到端解读

研究人员开发了CARDEA,这是一种用于端到端分析侵入性冠状动脉造影的大型视觉语言模型。系统能够处理多视角视频、选择关键帧,并评估冠状动脉优势类型和病变复杂程度。其Chain-of-Box方法将推理过程与空间边界框关联起来,使结论依据更易审查。采用可验证奖励的强化学习显著提升了零样本报告生成能力。在复杂程度评估中,CARDEA的准确率达到0.90,与介入心脏病专家相当;在领域变化下也保持了较好的表

IT早报9月13日:DeepSeek灰度测试AI语音对话,25位菲尔兹奖得主警告AI与数学界严重错位

DeepSeek正在App内灰度测试AI语音对话功能,部分用户可选择四种音色。与此同时,陶哲轩、彼得·舒尔茨等25位菲尔兹奖得主发表联合声明,警告AI公司与数学共同体之间出现“严重错位”,并对当前AI系统在数学领域的可靠性和研究价值提出质疑。行业预测称,中国年度Token消耗量预计将在2026年达到100亿亿,并在2030年前继续快速增长。微信也在密集测试多项AI功能,包括图片美化、修改和信息提取

Hugging Face 启动由联合创始人托马斯·沃尔夫领导的开放对齐计划

Hugging Face 宣布启动 Open Alignment Initiative,由联合创始人托马斯·沃尔夫领导。该计划旨在推动更开放的人工智能对齐与评估工作,并希望参与 Anthropic 首席执行官达里奥·阿莫代伊提到的“嵌入式评估员”项目。Hugging Face 表示,对齐问题不应仅由少数前沿人工智能实验室在封闭环境中解决。

OpenAI只想赢

过去几年,OpenAI不断进军竞争日益激烈的数学领域。本周,公司声称取得了迄今为止最重要的成果之一:解决了一个传说中的千禧年大奖难题。正常情况下,这会被视为历史性成就。然而,许多数学家正带着日益加深的担忧关注OpenAI持续扩张的步伐。根据现有信息,这一说法尚未得到独立验证。

我国词元需求呈爆发式增长,预计今年消耗量将达100万亿

中国电信研究院发布的报告预计,我国年度词元消耗量将在2026年达到100万亿,2030年超过3.5亿亿。报告称,人工智能产业发展重点正转向智能体的大规模落地和应用变现。未来两到三年,我国算力需求可能平均每年增长近10倍;到2029年,推理算力预计将占我国算力市场的80%。此外,我国头部科技企业2026年的人工智能资本支出预计接近6000亿元。上述数据均为报告中的预测。

AI研究员约翰·舒尔曼、贝伦·米利奇与查理·奥尼尔谈反对递归自我改进的论据、中国实验室进展和长期强化学习

德瓦尔凯什·帕特尔采访了AI研究员约翰·舒尔曼、贝伦·米利奇和查理·奥尼尔,讨论反对AI递归式自我改进的论据、中国AI实验室的进展,以及面向长期任务的强化学习。嘉宾还分析了当前系统的局限,并认为AI发展距离能力上限仍然很远。

ActReview:基于反驳引导的训练数据与评分类别奖励,生成可执行的同行评审

该研究探讨如何让大语言模型生成不仅能发现问题,还能指导作者进行具体修改的同行评审。ActReview将任务拆分为问题诊断和修改建议生成。研究人员利用OpenReview上的真实评审与反驳讨论,构建ActReview-40K数据集,将评审者提出的问题与作者回应及论文中的证据对应起来。Qwen3-8B-Base先经过监督微调,再使用GRPO和针对具体问题的评分类别奖励进行后训练。研究还推出了由人工整理

研究统一多模态模型中的图像标记器及其视觉语言特性

该研究分析图像标记器如何影响统一自回归多模态模型对图像和文本标记的联合建模。研究人员在多模态持续预训练过程中,跟踪文本、图像、文本到图像以及图像到文本预测的任务特定验证损失。结果表明,不同任务的损失呈现不同的扩展规律,并会对标记器产生不同的排序。基于共享文本词表计算的图像到文本损失,在跨标记器评估生成质量和视觉理解能力时,比文本到图像损失提供了更一致的信号。更好的图像重建能力并不一定带来更低的任务

IdeaAMBIG:研究想法规范中实现关键缺口的基准测试

IdeaAMBIG评估研究方法规范是否包含足够信息,使具备能力的实施者或编程代理无需无依据的假设,就能构建出预期方法。该基准包含660个有证据支持的实例:163个来自可复现性报告和GitHub问题的真实缺口,以及497个注入可实现参考资料中的受控合成缺口。研究评估三项能力:判断规范是否适合编码、定位缺陷,以及生成澄清行动。在测试的13个大语言模型中,最佳模型在真实实例上的宏观缺陷恢复率仅为9.6%

构建多语言桥梁:数据混合是语言内推理泛化的基础

一项研究探讨了如何让推理模型持续使用用户提示所采用的语言进行推理,而不是主要依赖英语。研究团队构建了拥有33.5亿参数的 Tiny Aya L2-Thinker,在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的六项基准测试中,实现了覆盖60种语言、超过93%的语言内推理率。研究表明,更广泛的语言覆盖、多语言非推理数据,以及足够强的英语推理基础,有助于将能力泛化到未参与训练的语言。研究团队将公

链接前先思考:多语言实体链接中的稀有性、推理与检索

一项研究分析了多模态实体链接系统在稀有实体上表现下降的原因。研究不只依赖页面浏览量等流行度指标,还采用知识图谱结构指标,识别文档记录不足或连接较弱的实体。根据稀有性的不同定义,当前最先进系统的准确率下降了15.4%至39.9%。研究人员提出了一种无需训练的框架,让具备推理能力的视觉语言模型反复搜索维基百科并动态收集证据。单独使用推理对稀有实体的提升并不明显;单独使用检索虽然能提高稀有实体准确率,却

MetroLLM-Bench 评估语言模型作为交通服务终端运行时

MetroLLM-Bench 是一个包含955个案例的基准测试,用于评估语言模型作为交通服务终端的决策层,覆盖六个真实地铁系统。测试内容包括路线规划、票价计算、运营中断、无障碍服务和对抗性输入等。经过参数高效微调的40亿参数 Qwen 3.5 模型在确定性的 Tier 1 评估中获得91.3分,超过受测的 GPT-5.6 系统,并追平更大型的 GPT-5.4 配置;其 Q4_K_M 模型占用空间为