AI 新闻中心

AI 新闻中心 过去24小时分析了 168 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

让循环模型设计得更好,第二部分:从固定点重新思考

这项研究探讨如何利用状态趋近固定点的特性,降低循环语言模型的训练和运行成本。该方法支持截断反向传播、在几乎不损失准确率的情况下共享终端 KV 缓存,并加快强化学习更新。蒸馏后的学生模型预填充速度最高提升至 1.79 倍。研究还改进了深度先验和输入注入:通过预测反馈学习的先验以及正交注入,使 1 亿至 16 亿参数模型的困惑度均有所下降。在 16 亿参数规模下,KV 缓存缩小至三分之一,仍达到使用完

CANOPY:面向多模态 RAG 的自适应粒度证据压缩

CANOPY 是一种用于多模态检索增强生成的检索后证据压缩框架。它将检索到的文本、表格、图像和视频表示为层级结构,并根据各区域与查询的相关性,选择不同详细程度的内容。当现有证据不足时,评估模块还可以请求有针对性的后续检索。在包含3,300万条异构数据的语料库上进行的五项问答基准测试中,CANOPY 的平均回答准确率高于所评估的检索基线。在未路由的 Qwen3-VL-8B-Instruct 设置中,

Kandinsky 6.0 Video:用于同步生成视频与音频的基础模型

Kandinsky 6.0 Video 是一系列可生成 5 秒视频的基础模型,支持同步生成 44 kHz 音频和口型,包括唇形同步。Lite 和 Pro 版本分别拥有 30 亿和 290 亿参数,支持文生音视频和图生音视频。内置超分辨率模型可将输出提升至全高清分辨率。该系统采用双流 CrossDiT 架构,通过双向交叉注意力连接视频流与音频流。开发团队以 MIT 许可证发布代码、模型检查点和 Di

InterMimicGen:通过自进化动作模仿扩展人形机器人的移动与操作能力

InterMimicGen 是一个将人类与物体交互数据转化为人形机器人可执行动作的框架。系统在保留全身协调以及手部与物体关系的同时,将异构示范数据重新映射到机器人上,并在仿真环境中训练基于物理的通用跟踪策略。数据循环会生成保持任务语义的动作和环境变化,仅保留仿真执行成功的版本,并将其用于下一轮训练,从而逐步扩大动作覆盖范围。实验还展示了该方法向真实机器人的迁移能力。

消息称快手旗下可灵 AI 已选定投行筹备赴港 IPO,目标募资至少 10 亿美元

据彭博社报道,快手旗下 AI 视频服务可灵 AI 已选定投行,为可能在香港进行的首次公开募股做准备。中金公司、高盛和瑞银据称正协助推进相关事宜。公司目标最早于明年上市,但融资规模和时间仍可能变动。据报道,可灵 AI 今年 7 月完成 28 亿美元融资,投前估值约为 150 亿美元。

散热厂商 Dynatron 确认 AMD EPYC“Verano”处理器采用 SB1 插槽

散热制造商 Dynatron 在官网列出 SB1-4U-ACTIVE 风冷散热器,显示其支持采用 Zen 6 架构、面向 Socket SB1 平台的 AMD EPYC 9006 LP“Verano”处理器。“Verano”瞄准 AI 加速器主机应用,预计支持 LPDDR5X SOCAMM2 内存,或于 2027 年推出。据称该处理器最多拥有 72 个 CPU 核心,频率最高可达 5GHz,并支持

PaLoRA:面向持续学习的节奏式低秩适配

许多基于 LoRA 的持续学习方法采用较小的学习率来减少遗忘,但固定设置无法阻止遗忘随着历史知识累积而加剧。该研究推导出一条根据既有知识有效秩调整梯度步幅的规则。PaLoRA结合自适应SVD截断来压缩历史知识、将梯度投影到先前任务的零空间,并根据秩调整更新节奏。实验显示,与已有方法相比,PaLoRA的表现持续提升,尤其适用于较长的任务序列。在具有挑战性的50任务ImageNet-A和ImageNe

ASCENT:通过自蒸馏已验证经验,在推理时在线训练长程智能体

该研究提出 ASCENT,使基于大语言模型的智能体在部署期间从已验证的任务轨迹中学习。该方法不直接模仿智能体生成的 token,而是使用模型初始状态的冻结副本,沿已验证轨迹进行事后预测,再将预测蒸馏到可持续保留的 LoRA 适配器中,以提升后续任务表现。在 ALFWorld、WebShop 和 AppWorld 上的评估显示,随着经验积累,任务成功率和交互效率均有所提高,且能力能够迁移到未见过的场

Groq 遭起诉:与英伟达 200 亿美元交易被指损害少数股东权益

Groq 因与英伟达达成的 200 亿美元非独家授权交易,在美国特拉华州衡平法院遭到起诉。两名仍持有 Groq 股份的前员工指控,这笔交易损害了少数股东的利益。诉状称,170 亿美元由股东共享,另有价值 30 亿美元的英伟达限制性股票分配给跳槽至英伟达的 Groq 员工。原告称,Groq 董事会存在严重利益冲突,未能为全体股东争取最佳条件,并不允许部分股东就交易投票;部分股份也被低估。由于交易采用

重新思考长视频效率:联合分配帧、像素与前端延迟

一项关于视觉语言模型(VLM)高效理解长视频的研究发现,在相同的 token 预算下,低分辨率密集时间采样可能优于原生分辨率稀疏采样。不过,对分辨率敏感的任务仍能从精选的高分辨率帧中受益。研究还表明,对于时长达一小时的视频,前端解码延迟主要取决于候选帧池的大小,而不是最终 token 预算。研究人员提出了无需训练、单次处理的 LoHi 框架,通过 VLM 原生的视频和图像通路,将低分辨率密集视频流

Prism:用于原生 2K 音视频联合生成模型训练的动态稀疏注意力

Prism 是一种动态稀疏注意力方法,用于以原生方式训练 2K 分辨率的音视频联合生成模型。它将序列划分为时空宏观区域,并根据局部视觉特征以及音视频耦合强度调整区块形状。混合选择策略还会为每个查询动态选择注意力区块。作者的实验显示,与完整注意力相比,Prism 将训练速度提高了 2.5 倍,同时生成质量更高。