AI 新闻中心

AI 新闻中心 过去30天分析了 915 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

韩国国家超算6号机将于12月投运,理论算力达5号机24倍

韩国国家超级计算机6号机预计于12月正式运行,为人工智能和前沿科研提供算力支持。该系统配备8496个GPU,包括英伟达GH200,以及9936个CPU,理论算力达到614PF。韩国政府计划将55%的算力用于产学研研究,15%分配给企业。其存储容量为205PB,网络速率不低于400Gbps,相比5号机,算力、存储容量和网络性能分别提升24倍、10倍和4倍。政府预计6号机有望进入全球超级计算机前十,目

我刚才说了什么?全双工语音模型的自我聆听

全双工语音模型能够同时听和说,但由于文本生成、语音合成与音频播放是异步进行的,模型认为自己说过的内容可能与用户实际听到的内容不一致。研究人员提出“Self-Listening”方法,将模型实际播放出的语音作为输入流反馈给模型。这样,模型就能根据用户真正听到的最后内容,在被打断后更准确地继续回答。研究还推出了 AnchorSpeech 数据集,用于追踪结构化回答中的哪些项目已经被说出。实验表明,加入

SynthGait-19K:用于步态参数估计的物理基础合成视频数据集

SynthGait-19K包含19,272段合成步行视频,来自437名受试者的6,427段动作捕捉序列。该数据集配有SMPL动作数据,以及六项具有临床意义的步态参数标注。Gait2Vid能够统一异构动作捕捉记录,并生成视角和场景外观可控的视频。研究对多种估计方法进行了基准测试,结果表明合成数据训练可以迁移到真实视频,但空间步态参数对视觉域偏移尤其敏感。

AI攻克数学难题,纽约大学教授质疑OpenAI利用其研究成果

纽约大学数学家Tristan Buckmaster与Anthropic数学家Levent Alpöge宣布在纳维-斯托克斯问题上取得进展,研究期间使用了Codex和Claude等工具。不久后,OpenAI公布了一份完整证明,称该成果由一个尚未公开的新模型发现。Buckmaster质疑OpenAI是否独立采用了相同且不寻常的方法,并指称公司可能利用了他们的研究信息。OpenAI否认在研究过程中访问特

OpenWAM:面向世界-动作模型系统化预训练的开放式模块化探索

OpenWAM 是一个用于系统研究机器人世界-动作模型的开放研究框架。其基础设施将生成式骨干、视觉表征、信息流、推理流程和训练数据拆分为可组合模块,从而能够通过受控实验比较不同设计。研究表明,具备足够能力的生成式骨干、紧凑且信息丰富的潜在空间、专门的动作建模能力,以及同步的联合去噪,有助于把世界知识转化为可执行控制。OpenWAM-α 使用约 6,400 小时的人类和机器人第一视角数据进行预训练,

A*-Thought-V2:利用大语言模型几何动力学实现高效潜在推理

A*-Thought-V2是一种旨在降低大语言模型思维链推理计算和上下文成本的框架。它将推理过程建模为隐藏状态轨迹:与问题到答案方向一致的步骤保留为显式文本,偏离方向的步骤则压缩为连续潜在标记。在Qwen3.5-9B和Qwen3.6-27B上的六项域内及域外基准测试中,平均准确率最高提升2.6个百分点,响应长度最多缩短一半。每计算单元的准确率提高了2.29倍,预处理和训练时间也显著减少。研究还发现

Marigold V2 重新探索扩散 Transformer 在单目深度估计中的应用

Marigold V2 将扩散 Transformer 模型用于从单张图像估计深度。该方法基于预训练流匹配模型进行单步推理,并在必要时采用量化,以降低运行成本。研究人员通过将模型内部表示与真实数据的语义特征对齐,并采用基于新型 Sinkhorn 损失的两阶段微调流程,解决朴素训练产生的伪影。结果显示,模型生成的深度图更加清晰,在分布外输入上的泛化能力也更强。在 KITTI 和 ETH3D 数据集上

新研究将大语言模型视为“认知病毒”

一个国际研究团队在一篇尚未经过同行评审的论文中提出,大语言模型的普及与一种文化传播形式存在相似之处。作者认为,AI 的实用性可能促使人们把越来越多的认知任务交给外部工具,从而加深依赖,并可能削弱独立推理能力。教育领域尤其值得关注,因为学生可能将批判性思考交给 AI 完成。不过,这篇论文提出的仍是理论框架,并未证明 AI 确实会损害人类认知能力。研究人员建议通过独立解决问题、核实信息、开展批判性讨论

UCF-Net融合CLIP与DINO,提升深度伪造图像检测的泛化能力

研究人员提出UCF-Net,这是一种面向篡改和生成式人脸检测的不确定性感知融合网络。该方法结合CLIP的语言对齐语义特征与DINO通过自监督学习获得的视觉结构特征,并从Transformer的多个深度提取层级特征,通过专家聚合进行自适应组合,再依据熵推导的不确定性对不同表示加权融合。在约400万张图像构成的统一基准上,UCF-Net在域内和跨域评测中均取得了参评方法最高的平均AUC。在包含来自八种

RelightFormer:用于多视角物体重新打光的前馈式生成Transformer

RelightFormer是一种生成式Transformer,可根据单张或多张图像直接为物体重新打光。该模型无需显式估计物体的内在属性,而是通过潜在照明模块,利用交叉注意力将目标环境光照图注入空间特征。排列不变的位置编码使模型能够对称处理无序的多视角输入,避免序列偏差。研究团队还构建了用于训练的Laval Objaverse数据集,包含9万个物体和3.9万种独特照明。实验结果显示,该模型在单视角、

谷歌联合绘制果蝇全脑图谱,开发者尝试用其模拟运行《毁灭战士》

谷歌研究院与霍华德·休斯医学研究所合作,利用人工智能重建了包含超16.6万个神经元的成年雄性果蝇完整中枢神经系统图谱(MaleCNS v1.0)。图谱发布后,开发者Alex Wormuth尝试利用该神经连接组模拟训练《毁灭战士》,通过将游戏画面转化为感觉神经刺激,并在角色受伤时给予多巴胺负反馈,观察其避险能力。另一个开发者也进行了控制《超级马力欧64》的类似尝试。

Cadence利用时间序列基础模型实现误差有界的需求数据有损压缩

Cadence将谷歌拥有3.3亿参数的时间序列模型TimesFM-3与自适应算术编码器结合,在限制每个样本误差的同时压缩需求时间序列。在297组序列与容差组合中,该方法相较经典预测器的中位数提升为21.4%;在相同数据规模下,最坏情况误差比降采样低28至56倍。计入上下文初始化成本后,端到端收益从六个月小时级数据的6.8%提升至渐近状态的15.1%。但该方法未能泛化到SDRBench:中位数结果下

SQS:通过稀疏量化子分布实现贝叶斯深度神经网络压缩

SQS是一种统一方法,通过同时进行权重剪枝和低比特量化来压缩大型神经网络。该方法采用贝叶斯变分学习,利用尖峰与平 slab 先验引入稀疏性,并使用高斯混合模型表示量化权重。研究人员针对原本难以处理的目标函数提出了高效近似,在尽量减少精度损失的同时实现压缩。针对ResNet、BERT-base、Llama 3.2和Qwen2.5的实验表明,与多种现有方法相比,SQS能够实现更高的压缩率,同时保持相近

早期编码,后期使用:Transformer何时开始依据对话伙伴的专业程度行动

一项研究分析了Transformer如何在对话过程中推断并利用对方的专业程度。该属性在模型早期层最容易被解码,但在网络中点之前便降至接近随机的水平。反事实修补实验显示,在早期层注入专业程度差异几乎不会改变输出;在中点之后注入,信号则几乎完整传播。研究结果界定了读取或操控依赖对话伙伴的行为时可能需要介入的位置。这是使用单一模型和合成语料库进行的初步验证。

测量机器人策略的语言迁移:将希腊语加入 Cosmos3 视觉-语言-动作策略

该研究考察了如何在不修改架构的情况下,仅使用机器改写的指令,将希腊语加入开放式视觉-语言-动作机器人系统。由于大多数语言都缺乏机器人示范数据,研究重点是可靠测量,而不仅是翻译。多种看似合理的评估方法都产生了误导性结论:颜色直方图指标会奖励噪声,单目标基准测试几乎无法区分正确的希腊语指令和故意错误的指令,训练损失也无法预测任务成功率。在包含90项任务、每个机械臂使用三个随机种子的区分性测试中,没有希