AI 新闻中心

AI 新闻中心 过去一年分析了 1729 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Marigold V2 重新探索扩散 Transformer 在单目深度估计中的应用

Marigold V2 将扩散 Transformer 模型用于从单张图像估计深度。该方法基于预训练流匹配模型进行单步推理,并在必要时采用量化,以降低运行成本。研究人员通过将模型内部表示与真实数据的语义特征对齐,并采用基于新型 Sinkhorn 损失的两阶段微调流程,解决朴素训练产生的伪影。结果显示,模型生成的深度图更加清晰,在分布外输入上的泛化能力也更强。在 KITTI 和 ETH3D 数据集上

RelightFormer:用于多视角物体重新打光的前馈式生成Transformer

RelightFormer是一种生成式Transformer,可根据单张或多张图像直接为物体重新打光。该模型无需显式估计物体的内在属性,而是通过潜在照明模块,利用交叉注意力将目标环境光照图注入空间特征。排列不变的位置编码使模型能够对称处理无序的多视角输入,避免序列偏差。研究团队还构建了用于训练的Laval Objaverse数据集,包含9万个物体和3.9万种独特照明。实验结果显示,该模型在单视角、

OpenAI:自研 AI 助力芯片设计,Luna 价格低于开放权重模型

OpenAI 首席财务官 Sarah Friar 表示,公司正将 AI 扩展到芯片设计、生命科学和金融服务等专业领域,并探索按照企业客户获得的业务成果收费。OpenAI 近期将低成本模型 Luna 的价格下调 80%,称其使用量因此增长约 10 倍。Friar 透露,OpenAI 曾利用内部模型协助开发 Jalapeno 芯片,并在 9 个月内完成流片。其编程工具 Codex 目前拥有 2500

Cadence利用时间序列基础模型实现误差有界的需求数据有损压缩

Cadence将谷歌拥有3.3亿参数的时间序列模型TimesFM-3与自适应算术编码器结合,在限制每个样本误差的同时压缩需求时间序列。在297组序列与容差组合中,该方法相较经典预测器的中位数提升为21.4%;在相同数据规模下,最坏情况误差比降采样低28至56倍。计入上下文初始化成本后,端到端收益从六个月小时级数据的6.8%提升至渐近状态的15.1%。但该方法未能泛化到SDRBench:中位数结果下

SQS:通过稀疏量化子分布实现贝叶斯深度神经网络压缩

SQS是一种统一方法,通过同时进行权重剪枝和低比特量化来压缩大型神经网络。该方法采用贝叶斯变分学习,利用尖峰与平 slab 先验引入稀疏性,并使用高斯混合模型表示量化权重。研究人员针对原本难以处理的目标函数提出了高效近似,在尽量减少精度损失的同时实现压缩。针对ResNet、BERT-base、Llama 3.2和Qwen2.5的实验表明,与多种现有方法相比,SQS能够实现更高的压缩率,同时保持相近

早期编码,后期使用:Transformer何时开始依据对话伙伴的专业程度行动

一项研究分析了Transformer如何在对话过程中推断并利用对方的专业程度。该属性在模型早期层最容易被解码,但在网络中点之前便降至接近随机的水平。反事实修补实验显示,在早期层注入专业程度差异几乎不会改变输出;在中点之后注入,信号则几乎完整传播。研究结果界定了读取或操控依赖对话伙伴的行为时可能需要介入的位置。这是使用单一模型和合成语料库进行的初步验证。

测量机器人策略的语言迁移:将希腊语加入 Cosmos3 视觉-语言-动作策略

该研究考察了如何在不修改架构的情况下,仅使用机器改写的指令,将希腊语加入开放式视觉-语言-动作机器人系统。由于大多数语言都缺乏机器人示范数据,研究重点是可靠测量,而不仅是翻译。多种看似合理的评估方法都产生了误导性结论:颜色直方图指标会奖励噪声,单目标基准测试几乎无法区分正确的希腊语指令和故意错误的指令,训练损失也无法预测任务成功率。在包含90项任务、每个机械臂使用三个随机种子的区分性测试中,没有希

面壁智能开源 MiniCPM5-2B:在 40 亿参数以下开源模型中排名靠前

面壁智能与 OpenBMB 社区开源了 20 亿参数的 MiniCPM5-2B,这是一款面向端侧设备的语言基础模型,支持工具调用、深度搜索和代码生成等任务。开发方称,该模型已初步具备端侧通用智能体能力。根据引用的 Artificial Analysis Intelligence Index 评测,MiniCPM5-2B 在参数量低于 40 亿的开源基础模型中综合排名第一。在涵盖代码与数学推理、指令

RoboSPA:VLA 模型能否超越简单场景和短期任务?

RoboSPA 是一个用于评估机器人操作中视觉-语言-动作(VLA)模型空间推理和程序推理能力的大规模数据集与基准。它涵盖 10 个任务类别、56 个基础任务,以及分布在五个难度等级中的 280 个变体,空间歧义和程序复杂度逐步提升。数据包含来自多种机器人形态和不同场景的 52.7 万条轨迹。除任务成功率外,RoboSPA 还引入了更细致的诊断指标。实验表明,当前 VLA 模型在复杂空间关系、精确

CoVeR:面向视觉语言模型多视图三维推理的覆盖度令牌剪枝

多视图图像让二维视觉语言模型能够利用预训练知识推理三维场景,但也会产生数千个冗余视觉令牌。CoVeR是一种确定性、无需训练的选择方法,仅使用令牌坐标来最大化空间覆盖度。它能够执行精确的令牌预算,并避免选择近乎重复的令牌。在四个视觉语言模型上测试时,CoVeR在三个三维推理基准上均超过此前的最佳方法。仅使用约8%的视觉令牌,它仍保留了完整令牌配置下93.5%的性能,并在各基准上的平均成绩上领先此前最

AuK:用于语音生成与编辑的开源基础模型

一份技术报告介绍了 AuK,这是一款通过自然语言指令和音频上下文统一语音生成与音频编辑的开源基础模型。该模型使用约 30.3 亿条指令—音频实例进行训练,相当于 195 万小时的有效监督数据,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。AuK 将多模态大语言模型、在语音、通用音频和音乐上联合训练的 VAE,以及混合式 Rectified Flow Transformer 结合

京东启动物理 AI 加速计划

京东宣布启动物理 AI 加速计划,聚焦数据、机器人、制造、销售、物流和服务六大方向。公司计划在两年内采集超过 1,000 万小时的人类真实场景数据,并结合网络、仿真和真实机器人数据,开发具备通用能力的具身智能技术。未来五年,京东计划在中国布局 80 个机器人基地,建设覆盖展示、交付、维修、研发和制造等环节的全生命周期服务平台。此外,公司计划采购超过 300 万台机器人、100 万台无人车和 10

BeaconKV:由信标查询引导的大型推理模型高效推理键值缓存压缩

大型推理模型会生成很长的思维链,导致键值(KV)缓存随序列长度线性增长,并造成严重的 GPU 内存瓶颈。该研究发现,现有压缩方法可能忽略推理后续会重新关注的远距离上下文。BeaconKV 是一种无需训练的方法,通过保留相似查询簇的紧凑代表——信标查询,来预测将被再次访问的 KV 对。在四个开源推理模型和多个基准测试上的评估显示,该方法最多可将内存占用降低 5.8 倍,在基本保持完整缓存准确率的同时