AI 新闻中心

AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

SPARGen:通过原生多模态生成统一空间感知与推理

SPARGen 是一个多模态框架,将 3D 重建、密集对应和空间推理统一为指令条件生成任务。该方法把紧凑的结构化输出和语言输出序列化为标记序列,同时生成与图像对齐的密集几何场,使空间监督能够共同塑造原生多模态生成模型中的共享表示。在 3D 重建、对应关系和空间推理基准测试中,SPARGen 通过单一框架在多种空间任务上取得了具有竞争力的性能。

TailBooster:带有运行有效性约束的双层极值数据增强生成框架

TailBooster是一种生成式框架,用于为航空运输中的罕见极端事件生成合成表格数据,例如严重到达延误和异常飞行时间。统计层将训练重点放在分布尾部的极值上,基于自编码器的深度学习层则会过滤违反运行规律的合成记录,例如长距离航线对应过短飞行时间。基于美国航班数据的评估显示,该方法提高了数据的运行有效性和极端事件预测能力。与传统合成数据相比,极端飞行时间预测的平均绝对误差降低47%至49%,极端到达

规范优先的 AI 编程代理协作:跨越 189 个文件拆解核心架构不变量的案例研究

论文报告了一项单一且完整记录的案例研究:AI 编程代理在一个拥有 717,725 行代码的生产级 TypeScript 应用中完成了大规模架构重构。任务是移除“AI 请求期间 UI 面板必须保持打开”这一不变量,使流式生成在面板关闭后仍能继续,并在重新打开时无丢失或重复地连接回同一条实时流。代理先生成形式化规范,经过 14 轮审计后实施变更,再进行 17 轮验证。在人类执行程序前的 31 次审计中

CW-BASS v2:面向基础模型教师的饱和感知半监督分割伪标签选择

CW-BASS v2是一种用于半监督语义分割的伪标签选择方法。它针对DINOv2等基础模型教师面临的问题:当置信度分数出现饱和时,传统自适应阈值可能几乎保留所有预测,从而加剧确认偏差。该方法结合留出数据校准、按类别进行的无偏噪声估计,以及自适应置信度下限。单次门控机制会判断应采用严格筛选,还是使用自适应下限。在六个DINOv2教师上进行测试时,CW-BASS v2在Pascal VOC上接近已报告

中国科研团队发布大豆垂直大模型“丰菽”2.0,助力辅助育种

安徽农业大学研究团队发布了面向大豆科研与育种的生成式 AI 模型“丰菽”2.0。该多模态系统整合大豆种质资源、基因组、蛋白质、转录本、基因表达、病害、表型和育种试验数据,以及相关科研文献。升级后的多模型协同分析功能,可让多个通用大模型分别回答同一专业问题,再结合领域知识、私有数据和结构化规则,分析不同回答的共识、差异及证据完整性。模型目前可辅助开展病害诊断、育种亲本筛选、虚拟组合设计、表型数据解析

AI 可通过视觉线索以 87% 至 91% 的准确率识别照片拍摄地点

McAfee Labs 的一项研究发现,即使删除 GPS 和 EXIF 位置信息,AI 系统仍能识别出 87% 至 91% 受测旅行照片的拍摄地点。系统会分析建筑风格、商店招牌、道路标线、植被、地形和地标等照片中的视觉线索。海滩、酒店房间或河流等看似普通的场景,也可能包含足以判断国家甚至具体地点的信息。McAfee 警告,犯罪分子可能将这项能力用于个性化网络钓鱼,例如根据用户近期旅行经历发送虚假的

Claude 模型在历时 54 小时但未成功的黎曼猜想尝试中取得数学突破

据报道,一个 Claude 模型曾用 54 小时尝试解决黎曼猜想,虽然最终未能成功,但在过程中取得了数学进展。《华尔街日报》记者本·科恩称,该模型多次回应用户给予的鼓励。这一事件体现了先进 AI 模型数学能力的提升,但并不意味着这一著名数学难题已经得到经过验证的解决方案。

斯坦福调查:中国受访者对 AI 的兴奋度达84%,美国仅38%

斯坦福大学《AI Index 2026》报告显示,中国和美国公众对人工智能的态度存在明显差异。中国有84%的受访者表示对 AI 产品和服务感到兴奋,美国为38%;在信任度方面,中国为72%,美国为32%。报告称,中美 AI 模型的性能差距已基本消失,自2025年初以来,两国模型在主要评测中交替领先。2025年,产业界贡献了超过90%的知名前沿模型,企业和其他组织对 AI 的采用率也持续上升。斯坦福

海尔预计中国脑机接口市场2035年将突破千亿元

海尔盈康一生与天津大学脑机海河实验室达成长期合作,双方将围绕脑机接口的临床转化、产业应用和人才培养展开合作。海尔集团董事长兼首席执行官周云杰预计,中国脑机接口市场到2035年将突破千亿元。该数字属于企业预测,尚非经过独立验证的市场估算。双方希望推动实验室成果进入医疗机构和健康服务领域。今年7月,中国科研团队发布了一款脑电信号采集装置,称其首次实现跨地域同步采集1000多人脑电信号,或将支持神经大模

SKILLER:通过语言级强化学习从小型语言模型中提取可复用技能

SKILLER 是一个强化学习框架,能够自动为小型语言模型生成适配执行器的专属技能。该方法让更强的模型同时担任行动者和评判者,并将小模型智能体系统作为环境,所有强化学习信号均通过自然语言传递。研究人员使用 Qwen3.5-9B 和 Qwen3.5-4B,在五项基准测试中将其与三种开源方法和一种闭源方法进行比较。9B 模型的绝对提升幅度为 4.3 至 20.4 个百分点,4B 模型为 1.8 至 1

面向推理的思维级束搜索

在推理阶段增加计算量可以提升大型推理模型的性能,但现有方法通常效率不高。研究人员提出了 Gambit,一种针对部分推理轨迹执行束搜索的推理算法。该方法会定期剪除缺乏前景的轨迹,并立即从高质量前缀继续分支。轻量级评分器通过探测隐藏状态,将计算资源动态集中到最有希望的推理路径上,同时保持较高的硬件利用率。在多个模型和基准测试中,与剪枝基线相比,Gambit 在 HMMT-24 上最高提升 6.7 个百

面向可组合非结构化知识编辑的混合策略自编辑

该研究提出 HPSE,可在不改变无关知识的情况下更新大语言模型中的特定事实。现有非结构化知识编辑方法虽然能让模型回忆插入的段落,但往往无法回答其中单个事实的问题,也不能将这些事实组合起来进行多跳推理。HPSE 不需要外部监督,而是利用同一模型在特定上下文中的优势状态进行自蒸馏。当模型无法覆盖新知识时,混合式 rollout 会将缺失事实精准加入模型轨迹的相应位置,其余部分保持 on-policy。