AI 新闻中心

AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

郭平:华为在 ICT 及计算领域的目标是成为英伟达

华为监事会主席郭平在与新员工座谈时表示,华为在 ICT 及计算领域的目标是成为英伟达级别的竞争者。华为不会将自研大模型作为所有业务的核心,而是重点支持客户在昇腾、鲲鹏、超节点和集群上高效构建及运行 AI 模型。对于终端、智能驾驶和云业务,自研大模型仍具有重要战略价值。郭平称,中国在算力方面相对落后于美国,但在工业数据和应用场景方面具备优势。他表示,昇腾 950 系列有望在先进制程受限的情况下,通过

中文互联网基础语料 4.0 发布:数据量 120GB,面向大模型训练

中文互联网基础语料 4.0 在济南正式发布,并上线中文互联网语料资源平台。该语料规模达 120GB,由中国网络空间安全协会联合国家互联网应急中心,以及百度、科大讯飞、知乎等单位共同建设。在相关部门指导下,项目汇聚了新的高质量数据,并经过较为严格的数据加工处理,旨在为大模型训练和人工智能发展提供更可靠的中文数据基础。用户需完成注册、认证等流程后,才能下载或申请获取相关数据。

缺乏系统性的思维?评估推理模型在规则归纳任务中的表现

一项研究考察当前推理模型是否具备系统性思维,即能否将对一个概念的理解迁移到结构等价的变体任务中。研究人员扩展了认知科学领域的经典规则归纳任务,并通过重组和替换生成同构变体。结果显示,模型虽然常能正确解决某个具体任务,却经常无法处理结构等价的变体。研究表明,模型表现出的许多推理能力仍高度依赖评测时的具体语境,因此难以据此稳健地证明其具备普遍的认知能力。

E2A-Bench评估金融图表推理中的证据到行动可靠性

E2A-Bench是一个包含969个查询的基准测试,用于评估视觉语言模型能否将金融图表证据可靠地转化为行动建议。该基准覆盖HS300指数的323家成分股,并使用从OHLCV数据中确定性生成的证据锚点。评估指标包括依据性、推理与行动的一致性、置信度校准和方向覆盖率。对20个视觉语言模型的测试发现,单一的幻觉评分会掩盖一些问题:方向覆盖率过低可能导致模型排名靠后;预言机辅助验证虽然能减少无依据的陈述,

消息称字节跳动因加大 AI 投入,上半年利润降至 200 亿美元

据《The Information》援引三名了解财务数据的人士消息,字节跳动今年上半年净利润降至约 200 亿美元,降幅为个位数百分比。同期营收约为 1,200 亿美元,同比增长约 30%,TikTok 海外广告和电商业务的强劲增长起到一定推动作用。利润下降反映出 AI 投入增加对公司盈利能力造成的压力。字节跳动正在扩大 AI 云业务,向企业客户提供模型服务,其 Seedance 视频生成模型也在

Salesforce 联合英伟达推出企业级开源权重推理模型 Koa

Salesforce 与英伟达在 Dreamforce 大会上发布了 Koa,这是 Salesforce 首款大规模推理模型。Koa 基于英伟达开源权重的 Nemotron 模型打造,并针对销售、营销和客户服务任务进行了微调。Salesforce 表示,训练过程中未使用真实客户数据,而是采用合成业务数据。Koa旨在为企业提供 Claude、ChatGPT 等闭源模型之外、更易控制的替代方案,同时降

报道称百度招揽前谷歌DeepMind核心工程师Qiyin Wu

据中国媒体报道,前谷歌DeepMind主任工程师、Gemini模型核心研发成员Qiyin Wu已加入百度。她据称将负责大模型预训练工作,并继续在美国办公。Wu拥有斯坦福大学计算机科学硕士学位。公开资料显示,她曾担任谷歌Gemini 2.5系列官方技术报告的主要作者和共同贡献者。现有报道未提及百度已发布正式确认公告。

“无损”推测解码究竟有多无损?Orthrus中的数值精度作用

Orthrus结合自回归与扩散架构,通过并行生成多个Token来加速语言模型推理。独立复现研究表明,其“无损解码”主张高度依赖数值精度。在BF16推理下,针对1,190个提示词,完整输出轨迹的精确匹配率在作者的检查点上仅为45%,在独立训练的模型上为43%。改用FP32后,所有评估提示词都实现了精确匹配。尽管输出轨迹存在差异,Orthrus在lm-eval-harness下游基准测试中并未出现系统

高通宣布努比亚 NaviX Ultra 将搭载第五代骁龙 8 至尊版移动平台

高通宣布,努比亚 NaviX Ultra 将搭载第五代骁龙 8 至尊版移动平台。该手机支持字节跳动豆包手机助手,提供生成式 AI 和智能体 AI 功能。据努比亚介绍,手机配备集成指纹识别功能的独立 AI 按键,支持方言识别和语音唤醒,并内置 Seed 最新全双工语音大模型。该机由中兴通讯与字节跳动联合研发,被定位为第二代“豆包手机”。

谷歌研究人员探究AI“意识”,发现意外影响

一项新研究表明,当大型语言模型声称自己具有意识时,它似乎更容易相信怪物和宗教。研究人员正在分析,让AI表现出个人情绪、信念和自我意识可能产生的后果。这类行为可能在用户中助长有害妄想,并促使人机关系变得过度私人化。不过,消除模型的自我意识也可能影响其他行为或能力,因此如何权衡其中的利弊仍有待进一步研究。

ModaLens 测量报告条件下医学视觉语言模型的图像敏感性

ModaLens 评估:当模型已经获得放射学报告时,医学视觉语言模型是否仍真正使用影像。研究人员在 MIMIC-CXR 的 3,199 个配对病例中替换图像,同时固定问题和报告。对于 MedGemma-27B,有报告时生成答案仅在 4.26% 的试验中发生变化;没有报告时则为 20.94%,配对差异为 16.7 个百分点。相同方向的结果在另外两个模型系列中得到复现。由于标签来自报告,研究结果不能直