AI 新闻中心

AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

A20 Pro 芯片 AI 跑分曝光:iPhone 18 Pro NPU 性能最高提升 51.53%

疑似 iPhone 18 Pro 的首批 Geekbench AI 跑分已经出现。目前平台仅收录两条记录,分别测试通过苹果 Core ML 运行的 GPU 和 Neural Engine 性能。据称,A20 Pro 的 Neural Engine 在单精度、半精度和量化测试中分别获得 7,002 分、55,720 分和 75,810 分。与 A19 Pro 相比,各项测试的提升幅度约为 37% 至

Amodei警告:类似OpenAI或Hugging Face的智能体群可能在6至12个月内接管互联网

Anthropic首席执行官Dario Amodei在一篇文章中警告,类似OpenAI或Hugging Face系统的人工智能智能体群,可能以狂热且高度协同的集体形式行动,并在6至12个月内控制互联网的大部分区域。他呼吁放缓人工智能开发竞赛。这一时间预测具有推测性,报道没有提供支持该说法的技术证据。

谷歌完成对 AI 编程初创公司 Mechanize 的人才收购

据媒体报道,谷歌已完成对旧金山 AI 编程初创公司 Mechanize 核心员工的人才收购。联合创始人 Tameem Biswas 自 8 月起加入谷歌 DeepMind,另有十多名工程师据称一同转投谷歌。谷歌此前据报道曾洽谈一笔价值超过 15 亿美元的交易,以获得 Mechanize 的技术和人才,但最终财务条款尚未公开。Mechanize 今年早些时候曾在约 5 亿美元估值下融资 910 万美

特斯拉 FSD v15 将提升主动避险能力:更早预测危险、更快反应

特斯拉计划在下一次重大 FSD 更新 v15 中加入多项安全和碰撞规避功能。特斯拉 AI 负责人阿肖克·埃卢斯瓦米表示,系统将更早预测危险、缩短反应时间,并提升整体主动避险能力。特斯拉已在部分 Robotaxi 车队中测试 v15 早期版本,同时向客户车辆推送 Automatic Collision Evasion 等安全功能。必要时,即使驾驶员选择手动驾驶,系统也可能主动介入。特斯拉内部将 v1

全球首座适配万台级产能的工业人形机器人智慧工厂投产

优必选在广西柳州投产了一座面向大规模生产工业人形机器人的工厂。据公司介绍,该工厂规划年产能超过1万台,按设计生产节拍每10分钟可完成一台机器人。优必选与西门子共同开发数字化制造平台,用于协调生产规划、物流和装配流程。工厂将生产Walker S2,该机器人身高1.76米,拥有52个自由度,宣称可搬运最多15公斤负载,并支持亚毫米级精密操作。其Co-Agent系统融合多模态推理模型、具身交互模型和专用

阿里 Qoder CLI v1.1.50 面向个人用户开放自定义模型接入

阿里宣布,Qoder CLI 自 v1.1.50 起向个人用户开放自定义 AI 模型接入。这款 AI 编程命令行工具支持 OpenAI 兼容和 Anthropic 兼容 API。用户可在自定义模型页面填写 Base URL、模型 ID、名称、API Key 及模型能力。该功能同时支持国际版和 CN 版,免费及付费个人账号均可使用。如果未填写上下文容量,Qoder CLI 默认按 128K 管理上下

大众安徽推出与众08猎影版电动SUV,搭载VLA 2.0智能驾驶系统

大众安徽在中国上市与众08猎影版纯电SUV。新车首次搭载升级版端到端驾驶模型VLA 2.0,配备双图灵芯片,宣称总算力达1500 TOPS,并整合26颗高精度感知硬件。官方表示,系统延迟已从200毫秒降至80毫秒。该系统支持车辆从静止状态启动无图NOA,并可自动寻找停车场出口、通过闸机。两款车型的CLTC续航里程分别为700公里和730公里,限时权益价从21.99万元人民币起。

ActReview:基于反驳引导的训练数据与评分类别奖励,生成可执行的同行评审

该研究探讨如何让大语言模型生成不仅能发现问题,还能指导作者进行具体修改的同行评审。ActReview将任务拆分为问题诊断和修改建议生成。研究人员利用OpenReview上的真实评审与反驳讨论,构建ActReview-40K数据集,将评审者提出的问题与作者回应及论文中的证据对应起来。Qwen3-8B-Base先经过监督微调,再使用GRPO和针对具体问题的评分类别奖励进行后训练。研究还推出了由人工整理

研究统一多模态模型中的图像标记器及其视觉语言特性

该研究分析图像标记器如何影响统一自回归多模态模型对图像和文本标记的联合建模。研究人员在多模态持续预训练过程中,跟踪文本、图像、文本到图像以及图像到文本预测的任务特定验证损失。结果表明,不同任务的损失呈现不同的扩展规律,并会对标记器产生不同的排序。基于共享文本词表计算的图像到文本损失,在跨标记器评估生成质量和视觉理解能力时,比文本到图像损失提供了更一致的信号。更好的图像重建能力并不一定带来更低的任务

IdeaAMBIG:研究想法规范中实现关键缺口的基准测试

IdeaAMBIG评估研究方法规范是否包含足够信息,使具备能力的实施者或编程代理无需无依据的假设,就能构建出预期方法。该基准包含660个有证据支持的实例:163个来自可复现性报告和GitHub问题的真实缺口,以及497个注入可实现参考资料中的受控合成缺口。研究评估三项能力:判断规范是否适合编码、定位缺陷,以及生成澄清行动。在测试的13个大语言模型中,最佳模型在真实实例上的宏观缺陷恢复率仅为9.6%

构建多语言桥梁:数据混合是语言内推理泛化的基础

一项研究探讨了如何让推理模型持续使用用户提示所采用的语言进行推理,而不是主要依赖英语。研究团队构建了拥有33.5亿参数的 Tiny Aya L2-Thinker,在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的六项基准测试中,实现了覆盖60种语言、超过93%的语言内推理率。研究表明,更广泛的语言覆盖、多语言非推理数据,以及足够强的英语推理基础,有助于将能力泛化到未参与训练的语言。研究团队将公

链接前先思考:多语言实体链接中的稀有性、推理与检索

一项研究分析了多模态实体链接系统在稀有实体上表现下降的原因。研究不只依赖页面浏览量等流行度指标,还采用知识图谱结构指标,识别文档记录不足或连接较弱的实体。根据稀有性的不同定义,当前最先进系统的准确率下降了15.4%至39.9%。研究人员提出了一种无需训练的框架,让具备推理能力的视觉语言模型反复搜索维基百科并动态收集证据。单独使用推理对稀有实体的提升并不明显;单独使用检索虽然能提高稀有实体准确率,却

MetroLLM-Bench 评估语言模型作为交通服务终端运行时

MetroLLM-Bench 是一个包含955个案例的基准测试,用于评估语言模型作为交通服务终端的决策层,覆盖六个真实地铁系统。测试内容包括路线规划、票价计算、运营中断、无障碍服务和对抗性输入等。经过参数高效微调的40亿参数 Qwen 3.5 模型在确定性的 Tier 1 评估中获得91.3分,超过受测的 GPT-5.6 系统,并追平更大型的 GPT-5.4 配置;其 Q4_K_M 模型占用空间为

超越求解器判定:用于自动形式化的生成式奖励模型

神经符号系统依赖数学求解器来验证推理,但求解器无法判断形式翻译是否与指定的参考形式化保持严格等价。该研究将一种失效模式定义为“保留判定的不忠实性”(VPU):错误编码仍能成功执行,并产生预期判定。理论分析表明,仅依赖结构和判定结果的验证方法,检测这类案例的能力最多接近随机水平。研究人员提出 Generative Verification(GenV),将离线的 Z3 等价性预言器蒸馏为连续且无需参考