面向推测解码的验证感知训练
研究人员提出了 Verification-Aware Training(VAT),一种用于提升大语言模型推测解码性能的插件式训练方法。VAT在训练过程中模拟顺序验证流程,并将每个位置的接受与拒绝模式转化为监督信号。该方法结合轻量级验证头,以及在首次拒绝位置后重新开始权重衰减的自适应加权机制。VAT只修改训练目标,无需改变草稿模型架构、目标模型或推理流程。在EAGLE-3和DFlash搭配Qwen3
AI 新闻中心 过去30天分析了 1116 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
研究人员提出了 Verification-Aware Training(VAT),一种用于提升大语言模型推测解码性能的插件式训练方法。VAT在训练过程中模拟顺序验证流程,并将每个位置的接受与拒绝模式转化为监督信号。该方法结合轻量级验证头,以及在首次拒绝位置后重新开始权重衰减的自适应加权机制。VAT只修改训练目标,无需改变草稿模型架构、目标模型或推理流程。在EAGLE-3和DFlash搭配Qwen3
科大讯飞全资子公司词元星火宣布推出并开源两款面向端侧设备的通用人工智能模型:星火X2.5-4B和星火X2.5-1.7B。公司表示,两款模型原生支持最长达100万Token的上下文窗口。这一能力有望让更小型的设备在本地或离线环境中处理长文本、大量数据以及长期复杂任务。不过,公告未提供独立基准测试结果,也未公布具体硬件需求。
腾讯混元团队发布了Hy4 Preview轻量版。这款混合专家(MoE)语言模型总参数量达7700亿,通过Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略,将模型权重从接近1.5TB压缩至约214GB。在长文理解等主要任务上,轻量版整体保持稳定表现;MCP Atlas得分从83.7降至83.2,SWE-Bench Multi从82.9降至81.3。腾讯与prima.cpp的测试显示,使
研究人员提出了归一化低秩适配(NoRA),旨在提升 LoRA 训练的稳定性和效果。NoRA 可在训练过程中,或仅在初始化阶段,对下投影矩阵进行归一化。作者表示,该方法在预训练、监督微调和强化学习中能够加快收敛、提升性能与训练稳定性,并缓解灾难性遗忘。NoRA 不需要增加可训练参数,也不会带来额外的推理计算。
DreamX-Creator 1.0 是一套可联合生成视频和音频的紧凑型系统。其 70 亿参数生成器先分别处理视觉与音频流,再通过带门控的跨模态注意力机制进行耦合。系统采用经过筛选的时序一致多模态数据、渐进式联合训练,以及利用模态感知反馈的强化学习。针对 2K 输出,团队设计了一个精炼流程,将模型压缩为每个时间片段只需进行一次去噪评估。开发团队公开了 7B 生成器和 2K 精炼器,以支持统一音视频
潜在生成模型通常采用两阶段训练:先用变分自编码器学习重建,再在冻结的潜在空间中训练生成模型。研究人员指出,为重建优化的潜在表示不一定适合生成。分析表明,KL 散度目标中的熵项对于防止潜在空间坍塌至关重要,同时重建的学习速度更快、监督更强。GenFirst 因此先通过生成目标塑造潜在空间,再逐步加强重建,以恢复视觉细节。在 ImageNet-256 上,SiT 使用 CFG 时取得 0.97 的 g
Matrix-Game 3.5是一种用于实时生成持久虚拟环境的交互世界模型。新版本引入结合Patch Memory与tiled-PRoPE的几何感知记忆框架,将静态场景几何与动态主体分开建模,并通过两阶段渐进式蒸馏实现快速因果生成。这些改进旨在提升长时间场景记忆、精准摄像机控制、主体一致性和提示词驱动的世界生成能力。模型使用来自Unreal仿真环境、开放世界游戏和互联网视频的数据进行训练,研究团队
NavMCP将负责高层推理的视觉语言模型与负责闭环执行语义子目标的导航基础模型结合起来。意图、观测和记忆三个通道使系统能够决定需要寻找哪些证据,将导航过程转化为有依据的轨迹信息,并在多次调用之间保存发现、否定性证据和未解决目标。该方法无需重新训练任一模型,就能把孤立的导航回合转变为持续的具身交互。NavMCP在HM-EQA、MT-HM3D和EXPRESS-Bench上取得当前最佳结果,在HM-EQ
该研究介绍了 Qwen3.8-Flash-Next,这是一个拥有 1250 亿参数的稀疏混合专家模型,每个 token 仅激活 60 亿参数。在 14 项预训练基准测试中,该模型有 8 项超过前代 397B-A17B,其余测试最多落后 2.6 分;同时,激活参数和训练 token 数降至三分之一,训练 FLOPs 约为九分之一。其架构结合了 Gated DeltaNet、全局注意力、Qwen Sp
CogEvol是一系列专为学习环境生成设计的模型,可将课程简介一次性转换为完整的学习内容,包括结构化JSON幻灯片和自包含的交互式HTML页面。开发团队称,该系统基于22万次生产请求开发,生成一页幻灯片的中位时间为17秒,生成交互式页面为59秒。CogEvol-27B在幻灯片质量评测中得分83.7,在包含500个案例的交互式HTML基准测试中得分63.7。CogEvol-4B已依据Apache 2
MNIST-PRO是一项用于研究AI智能体如何在部分可观测环境中构建和更新感知状态的基准测试。它将手写数字识别转换为基于连续视觉片段的搜索任务,并限制对先前观察结果的回看能力。研究使用四种记忆表示评估了10个多模态模型:原始视觉历史、文本状态、结构化网格地图和整合视觉画布。模型在完全可观测条件下表现良好,但部分可观测性暴露出明显的性能差距。研究发现三项主要瓶颈:整合零散视觉信息、持续探索直到观察完
CAST 是一种训练框架,可将任务结果转换为动作级的结构化理由,用于解释代理的操作是否有效。这些批评信息随后被用于训练和优化执行长期、交互式工具调用任务的大语言模型代理。在动态工具调用基准测试中,使用 CAST 微调 Qwen3 系列模型后,代理的可靠性得到提升。在零售任务上,CAST 的 pass^4 表现比 GPT-OSS-120B 高出超过 10 个百分点;在跨领域的远程医疗场景中,表现又提
科大讯飞旗下词元星火发布了开源模型星火 X2.5-4B 和星火 X2.5-1.7B。两款模型原生支持最长 100 万 Token 的上下文窗口,并针对智能体、代码、数学和指令遵循等能力进行优化。据介绍,模型在国产算力平台上完成全流程训练,使用了约 20 万亿 Token 的多样化数据。在 Domux 智能家居测试集上,1.7B 模型的控制指令端到端执行正确率达到 90.3%,平均响应时间为 0.8
本文研究在人类监督逐步退出学习闭环后,大型推理模型(LRM)如何继续提升。对于数学和编程等结果可自动验证的任务,利用可验证奖励的强化学习已经显著改善了推理能力;但在开放式任务和智能体任务中,可靠奖励更难获得。研究分析了两个相互关联的方向:从逐个实例的人类判断转向可复用的验证器和无需人工反馈的奖励,以及从人工策划的任务和环境转向模型自行生成的课程、构建的环境和自主协同进化。L0至L4的五级框架用于标
本研究探讨功能向量能否跨语言引导大语言模型完成任务。研究人员从上下文示例中提取潜在任务方向,并将其应用于多语言、多标签情感识别。由源语言提取的功能向量在其他语言中也能显著提升性能,包括推理时不提供示例的零样本设置。结果表明,功能向量捕捉的可能是与语言无关但与任务相关的信号,而不只是特定语言的词汇模式。研究还发现,每个模型用于构建有效功能向量的最佳注意力头范围相对稳定,并且在不同语言之间保持一致。该