面向推测解码的验证感知训练
研究人员提出了 Verification-Aware Training(VAT),一种用于提升大语言模型推测解码性能的插件式训练方法。VAT在训练过程中模拟顺序验证流程,并将每个位置的接受与拒绝模式转化为监督信号。该方法结合轻量级验证头,以及在首次拒绝位置后重新开始权重衰减的自适应加权机制。VAT只修改训练目标,无需改变草稿模型架构、目标模型或推理流程。在EAGLE-3和DFlash搭配Qwen3
AI 新闻中心 过去一年分析了 1380 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
研究人员提出了 Verification-Aware Training(VAT),一种用于提升大语言模型推测解码性能的插件式训练方法。VAT在训练过程中模拟顺序验证流程,并将每个位置的接受与拒绝模式转化为监督信号。该方法结合轻量级验证头,以及在首次拒绝位置后重新开始权重衰减的自适应加权机制。VAT只修改训练目标,无需改变草稿模型架构、目标模型或推理流程。在EAGLE-3和DFlash搭配Qwen3
腾讯混元团队发布了Hy4 Preview轻量版。这款混合专家(MoE)语言模型总参数量达7700亿,通过Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略,将模型权重从接近1.5TB压缩至约214GB。在长文理解等主要任务上,轻量版整体保持稳定表现;MCP Atlas得分从83.7降至83.2,SWE-Bench Multi从82.9降至81.3。腾讯与prima.cpp的测试显示,使
强化微调(RFT)越来越多地用于提升大型模型的推理能力,但其效果很大程度上取决于训练数据的选择。现有多数数据中心型RFT方法采用静态或启发式样本选择,忽略了样本价值会随着策略学习过程发生变化。Dynamic Important Example Mining(DIEM)提出了一种在RFT过程中自适应利用数据的框架。该方法通过梯度对齐估计每个样本对策略改进的边际贡献,并在保持梯度幅度的同时重新调整批次
研究人员提出了归一化低秩适配(NoRA),旨在提升 LoRA 训练的稳定性和效果。NoRA 可在训练过程中,或仅在初始化阶段,对下投影矩阵进行归一化。作者表示,该方法在预训练、监督微调和强化学习中能够加快收敛、提升性能与训练稳定性,并缓解灾难性遗忘。NoRA 不需要增加可训练参数,也不会带来额外的推理计算。
DreamX-Creator 1.0 是一套可联合生成视频和音频的紧凑型系统。其 70 亿参数生成器先分别处理视觉与音频流,再通过带门控的跨模态注意力机制进行耦合。系统采用经过筛选的时序一致多模态数据、渐进式联合训练,以及利用模态感知反馈的强化学习。针对 2K 输出,团队设计了一个精炼流程,将模型压缩为每个时间片段只需进行一次去噪评估。开发团队公开了 7B 生成器和 2K 精炼器,以支持统一音视频
潜在生成模型通常采用两阶段训练:先用变分自编码器学习重建,再在冻结的潜在空间中训练生成模型。研究人员指出,为重建优化的潜在表示不一定适合生成。分析表明,KL 散度目标中的熵项对于防止潜在空间坍塌至关重要,同时重建的学习速度更快、监督更强。GenFirst 因此先通过生成目标塑造潜在空间,再逐步加强重建,以恢复视觉细节。在 ImageNet-256 上,SiT 使用 CFG 时取得 0.97 的 g
Matrix-Game 3.5是一种用于实时生成持久虚拟环境的交互世界模型。新版本引入结合Patch Memory与tiled-PRoPE的几何感知记忆框架,将静态场景几何与动态主体分开建模,并通过两阶段渐进式蒸馏实现快速因果生成。这些改进旨在提升长时间场景记忆、精准摄像机控制、主体一致性和提示词驱动的世界生成能力。模型使用来自Unreal仿真环境、开放世界游戏和互联网视频的数据进行训练,研究团队
NavMCP将负责高层推理的视觉语言模型与负责闭环执行语义子目标的导航基础模型结合起来。意图、观测和记忆三个通道使系统能够决定需要寻找哪些证据,将导航过程转化为有依据的轨迹信息,并在多次调用之间保存发现、否定性证据和未解决目标。该方法无需重新训练任一模型,就能把孤立的导航回合转变为持续的具身交互。NavMCP在HM-EQA、MT-HM3D和EXPRESS-Bench上取得当前最佳结果,在HM-EQ
该研究介绍了 Qwen3.8-Flash-Next,这是一个拥有 1250 亿参数的稀疏混合专家模型,每个 token 仅激活 60 亿参数。在 14 项预训练基准测试中,该模型有 8 项超过前代 397B-A17B,其余测试最多落后 2.6 分;同时,激活参数和训练 token 数降至三分之一,训练 FLOPs 约为九分之一。其架构结合了 Gated DeltaNet、全局注意力、Qwen Sp
PaperBanana-Interact研究如何利用多轮人类反馈迭代改进科学图表。研究人员发布了MTPaperBananaBench基准,其中包含292张图像和3,518项经过标注的用户需求,并构建了用于大规模评测的用户模拟器。对现有多轮系统的评估发现了两种常见失败模式:随着轮次增加,图表质量逐步下降的“质量漂移”;以及后续修改丢失此前已实现功能的“遗忘”。PaperBanana-Interact
CogEvol是一系列专为学习环境生成设计的模型,可将课程简介一次性转换为完整的学习内容,包括结构化JSON幻灯片和自包含的交互式HTML页面。开发团队称,该系统基于22万次生产请求开发,生成一页幻灯片的中位时间为17秒,生成交互式页面为59秒。CogEvol-27B在幻灯片质量评测中得分83.7,在包含500个案例的交互式HTML基准测试中得分63.7。CogEvol-4B已依据Apache 2
Lucida是一种将真实室内环境重建为完整、可编辑三维物体资产的方法,面向机器人仿真和具身智能。系统首先构建场景图,为每个物体保留多视角证据;随后根据这些证据生成完整资产,并通过GizmoAct完成物体放置。视觉语言模型以闭环GUI交互的方式控制放置过程,并自行判断对齐是否达到要求。根据论文作者报告,Lucida在R2S-Scene上的mAP较Boxer提升69%;在CA-1M上,ADD-SB@0
MNIST-PRO是一项用于研究AI智能体如何在部分可观测环境中构建和更新感知状态的基准测试。它将手写数字识别转换为基于连续视觉片段的搜索任务,并限制对先前观察结果的回看能力。研究使用四种记忆表示评估了10个多模态模型:原始视觉历史、文本状态、结构化网格地图和整合视觉画布。模型在完全可观测条件下表现良好,但部分可观测性暴露出明显的性能差距。研究发现三项主要瓶颈:整合零散视觉信息、持续探索直到观察完
BLARM是一种由视频驱动静态3D网格动画的前馈方法。给定单目视频和物体网格,系统能够生成时间上连贯的动画网格,无需显式骨架、笼状模型、蒙皮权重或绑定标注。该方法使用一组随时间变化的学习型刚性运动组件,以及将顶点分配给组件的时间不变权重来表示运动。几何特征和视频特征通过分解式时空注意力进行融合。训练过程结合轨迹重建、熵正则化和运动感知对比学习,旨在通过低维变形空间生成准确、稳定且具有一定可解释性的
CAST 是一种训练框架,可将任务结果转换为动作级的结构化理由,用于解释代理的操作是否有效。这些批评信息随后被用于训练和优化执行长期、交互式工具调用任务的大语言模型代理。在动态工具调用基准测试中,使用 CAST 微调 Qwen3 系列模型后,代理的可靠性得到提升。在零售任务上,CAST 的 pass^4 表现比 GPT-OSS-120B 高出超过 10 个百分点;在跨领域的远程医疗场景中,表现又提