让循环模型设计得更好,第二部分:从固定点重新思考
这项研究探讨如何利用状态趋近固定点的特性,降低循环语言模型的训练和运行成本。该方法支持截断反向传播、在几乎不损失准确率的情况下共享终端 KV 缓存,并加快强化学习更新。蒸馏后的学生模型预填充速度最高提升至 1.79 倍。研究还改进了深度先验和输入注入:通过预测反馈学习的先验以及正交注入,使 1 亿至 16 亿参数模型的困惑度均有所下降。在 16 亿参数规模下,KV 缓存缩小至三分之一,仍达到使用完
AI 新闻中心 过去24小时分析了 168 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
这项研究探讨如何利用状态趋近固定点的特性,降低循环语言模型的训练和运行成本。该方法支持截断反向传播、在几乎不损失准确率的情况下共享终端 KV 缓存,并加快强化学习更新。蒸馏后的学生模型预填充速度最高提升至 1.79 倍。研究还改进了深度先验和输入注入:通过预测反馈学习的先验以及正交注入,使 1 亿至 16 亿参数模型的困惑度均有所下降。在 16 亿参数规模下,KV 缓存缩小至三分之一,仍达到使用完
据彭博社援引消息人士报道,Moonshot AI已完成最后一轮私募融资,估值约为500亿美元。这家人工智能公司计划于2027年第一季度在香港首次公开募股,目标募资最高达50亿美元。
CANOPY 是一种用于多模态检索增强生成的检索后证据压缩框架。它将检索到的文本、表格、图像和视频表示为层级结构,并根据各区域与查询的相关性,选择不同详细程度的内容。当现有证据不足时,评估模块还可以请求有针对性的后续检索。在包含3,300万条异构数据的语料库上进行的五项问答基准测试中,CANOPY 的平均回答准确率高于所评估的检索基线。在未路由的 Qwen3-VL-8B-Instruct 设置中,
Kandinsky 6.0 Video 是一系列可生成 5 秒视频的基础模型,支持同步生成 44 kHz 音频和口型,包括唇形同步。Lite 和 Pro 版本分别拥有 30 亿和 290 亿参数,支持文生音视频和图生音视频。内置超分辨率模型可将输出提升至全高清分辨率。该系统采用双流 CrossDiT 架构,通过双向交叉注意力连接视频流与音频流。开发团队以 MIT 许可证发布代码、模型检查点和 Di
InterMimicGen 是一个将人类与物体交互数据转化为人形机器人可执行动作的框架。系统在保留全身协调以及手部与物体关系的同时,将异构示范数据重新映射到机器人上,并在仿真环境中训练基于物理的通用跟踪策略。数据循环会生成保持任务语义的动作和环境变化,仅保留仿真执行成功的版本,并将其用于下一轮训练,从而逐步扩大动作覆盖范围。实验还展示了该方法向真实机器人的迁移能力。
据彭博社报道,快手旗下 AI 视频服务可灵 AI 已选定投行,为可能在香港进行的首次公开募股做准备。中金公司、高盛和瑞银据称正协助推进相关事宜。公司目标最早于明年上市,但融资规模和时间仍可能变动。据报道,可灵 AI 今年 7 月完成 28 亿美元融资,投前估值约为 150 亿美元。
散热制造商 Dynatron 在官网列出 SB1-4U-ACTIVE 风冷散热器,显示其支持采用 Zen 6 架构、面向 Socket SB1 平台的 AMD EPYC 9006 LP“Verano”处理器。“Verano”瞄准 AI 加速器主机应用,预计支持 LPDDR5X SOCAMM2 内存,或于 2027 年推出。据称该处理器最多拥有 72 个 CPU 核心,频率最高可达 5GHz,并支持
许多基于 LoRA 的持续学习方法采用较小的学习率来减少遗忘,但固定设置无法阻止遗忘随着历史知识累积而加剧。该研究推导出一条根据既有知识有效秩调整梯度步幅的规则。PaLoRA结合自适应SVD截断来压缩历史知识、将梯度投影到先前任务的零空间,并根据秩调整更新节奏。实验显示,与已有方法相比,PaLoRA的表现持续提升,尤其适用于较长的任务序列。在具有挑战性的50任务ImageNet-A和ImageNe
该研究提出 ASCENT,使基于大语言模型的智能体在部署期间从已验证的任务轨迹中学习。该方法不直接模仿智能体生成的 token,而是使用模型初始状态的冻结副本,沿已验证轨迹进行事后预测,再将预测蒸馏到可持续保留的 LoRA 适配器中,以提升后续任务表现。在 ALFWorld、WebShop 和 AppWorld 上的评估显示,随着经验积累,任务成功率和交互效率均有所提高,且能力能够迁移到未见过的场
微软已为 Word Copilot 的回复添加来源链接。用户可以直接打开原始网页或内部文档,核对信息的上下文和准确性。此举旨在提高透明度,帮助用户发现错误或编造的内容。微软还优化了 Copilot Chat,并扩展了 Copilot 应用的功能。
Groq 因与英伟达达成的 200 亿美元非独家授权交易,在美国特拉华州衡平法院遭到起诉。两名仍持有 Groq 股份的前员工指控,这笔交易损害了少数股东的利益。诉状称,170 亿美元由股东共享,另有价值 30 亿美元的英伟达限制性股票分配给跳槽至英伟达的 Groq 员工。原告称,Groq 董事会存在严重利益冲突,未能为全体股东争取最佳条件,并不允许部分股东就交易投票;部分股份也被低估。由于交易采用
快手科技旗下的Kling AI已为计划中的香港首次公开募股选定银行。据知情人士透露,此次IPO可能至少筹集10亿美元。
视频人工智能初创公司Higgsfield首席执行官亚历克斯·马什拉博夫表示,公司正基于当前业绩,朝年化营收超过10亿美元的目标迈进。他还介绍了公司的增长战略以及在亚太市场的业务规划。马什拉博夫接受了彭博社节目《亚洲贸易》的主持人谢莉·安独家采访。
一项关于视觉语言模型(VLM)高效理解长视频的研究发现,在相同的 token 预算下,低分辨率密集时间采样可能优于原生分辨率稀疏采样。不过,对分辨率敏感的任务仍能从精选的高分辨率帧中受益。研究还表明,对于时长达一小时的视频,前端解码延迟主要取决于候选帧池的大小,而不是最终 token 预算。研究人员提出了无需训练、单次处理的 LoHi 框架,通过 VLM 原生的视频和图像通路,将低分辨率密集视频流
Prism 是一种动态稀疏注意力方法,用于以原生方式训练 2K 分辨率的音视频联合生成模型。它将序列划分为时空宏观区域,并根据局部视觉特征以及音视频耦合强度调整区块形状。混合选择策略还会为每个查询动态选择注意力区块。作者的实验显示,与完整注意力相比,Prism 将训练速度提高了 2.5 倍,同时生成质量更高。