通过目标侧读取器适配实现跨模型记忆迁移
该研究探讨如何在不同语言模型之间迁移外部且冻结的知识记忆。研究人员将一个在源模型上训练的记忆连接到目标模型,只训练一个轻量级读取器。结果表明,存储的知识内容和正确的寻址方式都很重要,但记忆只有在读取器与目标模型对齐后才能有效发挥作用。在受控问答评测中,双层四分支读取器取得了38.8的平均分,几乎缩小了与同模型复用之间的差距。如果源读取器与目标接口直接兼容,冻结的记忆无需目标侧训练也能提供明显效用;
AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究探讨如何在不同语言模型之间迁移外部且冻结的知识记忆。研究人员将一个在源模型上训练的记忆连接到目标模型,只训练一个轻量级读取器。结果表明,存储的知识内容和正确的寻址方式都很重要,但记忆只有在读取器与目标模型对齐后才能有效发挥作用。在受控问答评测中,双层四分支读取器取得了38.8的平均分,几乎缩小了与同模型复用之间的差距。如果源读取器与目标接口直接兼容,冻结的记忆无需目标侧训练也能提供明显效用;
该研究探讨了用于扩展 CLIP 类视觉编码器的混合专家架构。研究人员发现,细粒度专家拓扑结构的表现优于密集模型和标准 MoE 架构。论文还提出了一种无需辅助损失的专家均衡方法,以及用于降低推理延迟开销的专用 MoE 内核。为提升视频能力并保留图像知识,研究采用了帧级蒸馏和一种新的冻结机制。研究团队预训练了多个规模的 MoE-ViE 模型,均稳定超过对应的密集模型。最大模型以相当于其 76% 的延迟
四川具身人形机器人科技推出情感交互人形机器人“爱湫”,售价 9.8 万元起。公司称,该机器人依托情感—语言—动作模型和自研多模态情感计算引擎,提供情绪感知与交互决策能力。产品配备 3D 超短焦投影面部,可自定义脸部效果,最高支持 32 个自由度,并可选三指或五指灵巧手,采用侧插式可更换电池。官方公布的续航时间为 3 小时。其“全球首个”相关表述属于企业自身宣传,尚缺乏独立验证。
EditBridge是一种支持最高4K分辨率图像编辑的扩散模型框架。该方法不从噪声重新生成高分辨率结果,而是结合原始高分辨率图像,对低分辨率编辑结果进行细化,以保留真实细节并减少与原图不一致的内容和纹理瑕疵。其先验引导的块级稀疏注意力机制,将跨图像交互限制在语义对应区域,从而降低计算开销。报告的实验显示,该方法在2K下实现了3.6至8.4倍加速,并可在61秒内完成4K图像编辑。
AI先驱、图灵奖得主里奇·萨顿表示,AI行业日益依赖合成训练数据,可能正走向错误方向。由算法或AI生成的数据无法完全替代真实世界的经验,因为现实物理环境的复杂性难以通过模拟完整重现。萨顿主张,AI智能体应通过与真实环境互动、观察行动结果来持续学习。OpenAI和谷歌等公司积极寻找专有真实数据,也反映出这类数据对模型训练的价值不断提升。萨顿近期与前学生Khurram Javed共同创办Oak Lab
CoinVE-200K 是一个面向组合式指令引导视频编辑的数据集,旨在让模型在同一段视频中理解并执行多个编辑意图。该数据集包含最高 201 帧的 1080p 视频编辑对,每个样本涵盖 2 至 5 个原子编辑操作,涉及人物、物体和背景,并支持添加、移除、修改和风格化。研究团队还推出了用于评估组合式视频编辑的 CoinVE-Bench,以及基于 Wan2.1-T2V-14B 和 Qwen3-VL-8B
斯坦福大学等机构研究人员在《美国国家科学院院刊》发表研究,分析了715名美国X平台用户的资讯流和互动行为。结果显示,X的推荐算法可能更倾向于推送与用户价值观不一致的帖子,从而引发愤怒、回复等更强烈的反应。这可能形成“愤怒带来互动、互动促使系统继续推荐类似内容”的反馈循环。研究人员指出,社交媒体推荐算法缺乏透明度,可能影响公共舆论。X尚未正式回应这项研究。平台前产品负责人Nikita Bier表示,
MathForm是一套用于构建验证训练数据的框架,旨在将数学命题转换为Lean 4等机器可验证的形式语言。系统在生成前从Mathlib检索相关定义和已有形式化内容,并利用编译器诊断与语义一致性反馈对结果进行迭代修订。由此构建的FormalVerse数据集包含约36.7万个经过验证的示例。经过监督微调和强化学习训练后,MathForm-8B在六项基准测试中取得了88.06%的平均Pass@8语法检查
Agent Lightning v1.0 是一个轻量级开源框架,用于“代理运行框架驱动的强化学习”。在这种架构中,部署时使用的代理框架会直接参与模型后训练。该框架支持任意代理框架,并处理重新分词、优势计算、损失归一化和后端调度等挑战。在指令遵循、搜索和编程代理评测中,仅使用 6,000 个训练样本和适度算力,就将 Qwen3.5-9B 在 SWE-bench Verified 上的成绩从 41.8
HarnessRisk是一项评估AI智能体安全性的基准,覆盖运行框架配置、能力扩展、运行时操作、状态持久化、行动控制和事件恢复六个阶段。该基准包含128个沙盒案例,将合法用户目标与嵌入不受信任工作流工件中的对抗性指令配对。在三个运行框架、六个语言模型和14种配置上的测试显示,攻击成功率为12.6%至80.9%,实用性为75.0%至97.6%。在所有运行框架中,配置阶段最脆弱。研究还发现,模型即使能
Modular已将编程语言Mojo、其编译器及核心工具链全面开源,采用带有LLVM例外条款的Apache 2.0许可证。Mojo旨在解决传统语言在现代硬件,尤其是GPU和AI加速器上的性能限制。随着Mojo 1.0源码稳定版完成,编译器源码现已上线官方GitHub仓库。开发者可以使用Bazel构建编译器并运行测试,也可以使用预构建的nightly二进制版本,以节省编译时间。Mojo标准库自2024
该研究评估了在不同运行条件下,哪些记忆载体最适合长期运行的大语言模型智能体。研究在统一测试框架中比较了稠密与稀疏索引、文本和结构化存储、分层存储、基于精炼的记忆、参数更新,以及兼容激活机制的上下文方案。研究使用三个基础模型和四套基准测试,覆盖面向用户的问答与智能体决策,并测量26项性能和效率指标。结果显示,没有任何单一载体始终占优。广泛检索有利于长上下文事实问答,但过度检索可能使序列决策偏离关键行
一项新研究提出统一层方程,用七个组件描述多种图神经网络架构。该框架将信息“向哪里移动”与“传递什么”分离开来,并覆盖局部消息传递、注意力机制、谱滤波、全局通信、关系特定通道、高阶域和几何消息。研究人员通过对经典层的推导,以及对200多种架构的组件分析,展示了如何系统比较模型并设计结构一致的新架构。研究还分析了传播方式与过平滑、过压缩、异质性和表达能力之间的联系,并在特定假设下讨论单层依赖范围和实现
FreeToken 是一套面向边缘设备的推理系统,旨在让个人电脑运行混合专家(MoE)模型。系统围绕本地 AI 的硬件差异和代理任务动态变化,协同优化模型布局与加载、专家驻留、CPU-GPU 执行、代理状态复用以及运行时内存管理。FreeToken 支持 20 多个 MoE 模型,以及编程和工具调用代理,适用于从配备 8GB GPU 的笔记本电脑到单 GPU 工作站的多种设备。开发团队称,该系统可
研究人员提出了 TAMP-Nav,一种利用大型视觉语言模型进行具身导航的框架。系统不要求模型直接预测复杂的三维动作,而是先选择图像中的二维像素,再将其投影为三维坐标,由底层 SLAM 控制器执行。选择性推理和基于锚点的轨迹记忆机制减少了不必要的计算,同时保留关键历史信息。基于 GRPO 的两级对齐方法结合全局结果奖励与细粒度过程奖励。作者报告称,TAMP-Nav 在 R2R-CE 上达到 66.2