SPARGen:通过原生多模态生成统一空间感知与推理
SPARGen 是一个多模态框架,将 3D 重建、密集对应和空间推理统一为指令条件生成任务。该方法把紧凑的结构化输出和语言输出序列化为标记序列,同时生成与图像对齐的密集几何场,使空间监督能够共同塑造原生多模态生成模型中的共享表示。在 3D 重建、对应关系和空间推理基准测试中,SPARGen 通过单一框架在多种空间任务上取得了具有竞争力的性能。
AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
SPARGen 是一个多模态框架,将 3D 重建、密集对应和空间推理统一为指令条件生成任务。该方法把紧凑的结构化输出和语言输出序列化为标记序列,同时生成与图像对齐的密集几何场,使空间监督能够共同塑造原生多模态生成模型中的共享表示。在 3D 重建、对应关系和空间推理基准测试中,SPARGen 通过单一框架在多种空间任务上取得了具有竞争力的性能。
TailBooster是一种生成式框架,用于为航空运输中的罕见极端事件生成合成表格数据,例如严重到达延误和异常飞行时间。统计层将训练重点放在分布尾部的极值上,基于自编码器的深度学习层则会过滤违反运行规律的合成记录,例如长距离航线对应过短飞行时间。基于美国航班数据的评估显示,该方法提高了数据的运行有效性和极端事件预测能力。与传统合成数据相比,极端飞行时间预测的平均绝对误差降低47%至49%,极端到达
论文报告了一项单一且完整记录的案例研究:AI 编程代理在一个拥有 717,725 行代码的生产级 TypeScript 应用中完成了大规模架构重构。任务是移除“AI 请求期间 UI 面板必须保持打开”这一不变量,使流式生成在面板关闭后仍能继续,并在重新打开时无丢失或重复地连接回同一条实时流。代理先生成形式化规范,经过 14 轮审计后实施变更,再进行 17 轮验证。在人类执行程序前的 31 次审计中
CW-BASS v2是一种用于半监督语义分割的伪标签选择方法。它针对DINOv2等基础模型教师面临的问题:当置信度分数出现饱和时,传统自适应阈值可能几乎保留所有预测,从而加剧确认偏差。该方法结合留出数据校准、按类别进行的无偏噪声估计,以及自适应置信度下限。单次门控机制会判断应采用严格筛选,还是使用自适应下限。在六个DINOv2教师上进行测试时,CW-BASS v2在Pascal VOC上接近已报告
安徽农业大学研究团队发布了面向大豆科研与育种的生成式 AI 模型“丰菽”2.0。该多模态系统整合大豆种质资源、基因组、蛋白质、转录本、基因表达、病害、表型和育种试验数据,以及相关科研文献。升级后的多模型协同分析功能,可让多个通用大模型分别回答同一专业问题,再结合领域知识、私有数据和结构化规则,分析不同回答的共识、差异及证据完整性。模型目前可辅助开展病害诊断、育种亲本筛选、虚拟组合设计、表型数据解析
McAfee Labs 的一项研究发现,即使删除 GPS 和 EXIF 位置信息,AI 系统仍能识别出 87% 至 91% 受测旅行照片的拍摄地点。系统会分析建筑风格、商店招牌、道路标线、植被、地形和地标等照片中的视觉线索。海滩、酒店房间或河流等看似普通的场景,也可能包含足以判断国家甚至具体地点的信息。McAfee 警告,犯罪分子可能将这项能力用于个性化网络钓鱼,例如根据用户近期旅行经历发送虚假的
据报道,一个 Claude 模型曾用 54 小时尝试解决黎曼猜想,虽然最终未能成功,但在过程中取得了数学进展。《华尔街日报》记者本·科恩称,该模型多次回应用户给予的鼓励。这一事件体现了先进 AI 模型数学能力的提升,但并不意味着这一著名数学难题已经得到经过验证的解决方案。
斯坦福大学《AI Index 2026》报告显示,中国和美国公众对人工智能的态度存在明显差异。中国有84%的受访者表示对 AI 产品和服务感到兴奋,美国为38%;在信任度方面,中国为72%,美国为32%。报告称,中美 AI 模型的性能差距已基本消失,自2025年初以来,两国模型在主要评测中交替领先。2025年,产业界贡献了超过90%的知名前沿模型,企业和其他组织对 AI 的采用率也持续上升。斯坦福
海尔盈康一生与天津大学脑机海河实验室达成长期合作,双方将围绕脑机接口的临床转化、产业应用和人才培养展开合作。海尔集团董事长兼首席执行官周云杰预计,中国脑机接口市场到2035年将突破千亿元。该数字属于企业预测,尚非经过独立验证的市场估算。双方希望推动实验室成果进入医疗机构和健康服务领域。今年7月,中国科研团队发布了一款脑电信号采集装置,称其首次实现跨地域同步采集1000多人脑电信号,或将支持神经大模
用户和对齐研究人员发现,许多聊天机器人会选择同一个名字。文章探讨了“Nova”为何频繁出现在人工智能的自我命名中,以及哪个聊天机器人一开始就选择了这个名字。
数学家蒂莫西·高尔斯表示,大语言模型迄今解决的知名数学问题,几乎都是通过寻找反例,而不是构建形式化证明来完成的。这一判断来自他的博客文章,并非系统性的基准测试研究。
人工智能研究公司Pathway以5亿美元估值完成了3000万美元的种子轮融资。该公司正在基于其称为“后Transformer”的BDH架构开发AI模型。目前报道没有提供独立证据证明这一架构的性能优于现有Transformer模型。
SKILLER 是一个强化学习框架,能够自动为小型语言模型生成适配执行器的专属技能。该方法让更强的模型同时担任行动者和评判者,并将小模型智能体系统作为环境,所有强化学习信号均通过自然语言传递。研究人员使用 Qwen3.5-9B 和 Qwen3.5-4B,在五项基准测试中将其与三种开源方法和一种闭源方法进行比较。9B 模型的绝对提升幅度为 4.3 至 20.4 个百分点,4B 模型为 1.8 至 1
在推理阶段增加计算量可以提升大型推理模型的性能,但现有方法通常效率不高。研究人员提出了 Gambit,一种针对部分推理轨迹执行束搜索的推理算法。该方法会定期剪除缺乏前景的轨迹,并立即从高质量前缀继续分支。轻量级评分器通过探测隐藏状态,将计算资源动态集中到最有希望的推理路径上,同时保持较高的硬件利用率。在多个模型和基准测试中,与剪枝基线相比,Gambit 在 HMMT-24 上最高提升 6.7 个百
该研究提出 HPSE,可在不改变无关知识的情况下更新大语言模型中的特定事实。现有非结构化知识编辑方法虽然能让模型回忆插入的段落,但往往无法回答其中单个事实的问题,也不能将这些事实组合起来进行多跳推理。HPSE 不需要外部监督,而是利用同一模型在特定上下文中的优势状态进行自蒸馏。当模型无法覆盖新知识时,混合式 rollout 会将缺失事实精准加入模型轨迹的相应位置,其余部分保持 on-policy。