TransNormal-2 是一个基于 FLUX.2 的 Rectified Flow 框架,用于从单张图像估计表面法线。研究指出,VAE 编码器和解码器的八倍空间压缩是造成像素级误差的重要来源,尤其会影响物体边界。该方法结合了几何感知的像素空间损失,包括逆渲染一致性、von Mises–Fisher 角度损失和小波边缘正则化,并加入由 RGB 引导的轻量级几何细化模块。系统支持单步确定性推理。在
该研究提出因果视觉循环推理(CVRR),旨在确保多模态模型生成答案时真正使用潜在视觉计算。CVRR在预训练视觉语言模型处理图像后,从问题表示初始化循环状态,并通过反复读取相同的视觉证据来更新该状态。在解码前,系统会移除视觉状态和原始多模态KV缓存,因此只有最终循环状态能够将图像条件信息传递给答案。在多个基准测试中,CVRR在这一严格接口下仍保持了较强的视觉能力,而兼容的潜在推理方法未能恢复相当的性
TANGO 是一个面向人形机器人的视觉语言导航框架,用于处理障碍物密集的室内环境。不同于将导航简化为二维路径规划,TANGO 会持续调整机器人的全身,包括手臂位置、躯干姿态和步态,以无碰撞方式穿越复杂的三维空间。系统接收自然语言指令和机器人第一视角的 RGB 观测,直接预测包含 29 个自由度的关节空间动作。TANGO 完全在仿真环境中训练,通过全局路径规划、全身运动生成、面向障碍物的动作编辑以及
该研究提出 Mask Forcing,用于改进面向实时视频生成的自回归视频扩散模型蒸馏。现有的 Distribution Matching Distillation 方法受到反向 KL 目标函数的模式选择倾向影响,可能导致学生模型分布坍缩,并生成过度饱和或过度平滑的视频。Mask Forcing 在自回归自滚动过程中,沿空间和时间维度使用随机掩码,将更干净的信号注入噪声输入。这样可以促使学生模型探
该报告介绍了 Gander,这是一个将视频、语音和文本流式输入统一起来的端到端模型,旨在实现连续的多模态交互。其 Cerebellum-Brain 架构由 Cerebellum 负责实时对话与响应,Brain 负责复杂推理、工具调用和智能体任务。Streaming Thinker-Talker 设计支持低延迟、全双工交互,包括用户随时打断、模型主动提供中间反馈以及提出后续问题。内部人工评估显示,G
研究人员提出了在策略反向蒸馏(OPRD),旨在让更强的学生模型从较弱的教师模型中学习,同时超越教师的性能。OPRD在学生模型生成的轨迹上,评估教师策略相对于参考策略的变化,并仅放大得到验证器支持、且与该变化方向一致的策略梯度更新。这样既能利用教师指导加快训练,又不会将教师的能力上限强加给学生。在连续模型迁移和多教师蒸馏实验中,OPRD以更少的学生更新次数取得了优于现有强化学习和蒸馏方法的性能。研究
据博主 @超维界 透露,华为 Pura X View 和 Mate XT 2 手机支持将多模态 AI 模型下载并部署在设备端。用户据称可在约 6GB 的多模态增强模型和约 15GB 的多模态混合专家模型之间选择。两款模型均可在无网络状态下运行,功能包括本地图像生成、语音合成、相机 AI 超清增强、图库修图和人声播报。混合专家模型还可用于复杂任务理解、应用操控以及离线整理照片。相关信息来自博主爆料,
GE-Act 2.0是一种用于机器人操作的世界行动模型,通过预测未来状态来指导机器人行动。与许多依赖预训练视频生成模型的系统不同,其生成和行动组件均使用操作数据从零开始初始化和训练。该模型结合了控制导向自动编码器、单步视觉规划器和逆动力学模型。将联合训练数据从300小时扩展到3万小时后,两种机器人平台的成功率分别从17.1%提升至44.1%,以及从13.4%提升至31.1%。性能提升覆盖了大多数技
一项研究考察大语言模型中的激活引导向量,究竟是否反映了人类价值观的连贯语义结构,还是仅仅利用了与特定行为相关的捷径。研究人员依据施瓦茨基本人类价值理论,构建了涵盖20种价值观、2.6万个样本的基准测试。基于分布的方法部分恢复了理论预测的价值关系;以行为为中心的方法虽然取得相近的引导效果,但与预期价值结构的相关性较低。几何一致性随模型规模扩大而提升,却在指令微调后下降。代码和数据已公开。
MovieGrid 是一种用于生成由多个按时间排序镜头组成的长篇视频的后训练方法。它将长视频拆分为较短片段,排列在空间网格中并进行联合建模,从而实现片段之间的全局信息交换。研究团队从 1,000 部长篇视频构建了 MGLV 数据集,其中包含 5.4 万个网格视频,以及故事和角色标注。该方法结合 Grid Embedding、角色感知故事提示和 Grid Boundary Loss,提升镜头内及镜头
研究人员提出了一套端到端系统,通过在线协同训练草稿模型,加速强化学习后训练中成本占比很高的 rollout 生成。该系统将分支注意力融入上下文并行执行,并在不改变流水线调度的情况下,在不同流水线阶段之间传输目标模型的中间特征。在最大规模达1220亿参数的模型上进行的实验显示,rollout 和端到端处理速度均得到显著提升;其上下文并行设计还可扩展至25.6万 token,并比现有方法节省内存。代码
研究人员提出了 Kalman Delta Networks(KDN),这是一类面向线性注意力和高效长上下文处理的新模型。KDN不仅跟踪循环记忆状态,还跟踪其不确定性,并利用卡尔曼增益,根据累积证据和观测可靠性调整每次记忆更新。由于精确跟踪协方差难以在GPU上并行执行,研究还提出了支持结合扫描的对角和各向同性近似方案。在使用7.5亿和13亿参数模型进行的受控预训练中,KDN变体相比领先的线性注意力模
一项研究提出“反馈增强环境”(FEE),旨在解决使用强化学习训练大型语言模型自主智能体时的奖励稀疏问题。FEE不直接指导智能体的行动,而是在探索后期丰富其观测信息。在SciWorld和BFCL基准测试中,研究人员使用不同规模的Qwen3模型以及GRPO、GSPO和DAPO算法进行大规模实验,结果显示其性能持续优于标准环境。研究表明,FEE能够稳定训练过程、促进对困难状态空间的主动探索,并使环境指导
Miles v0.1 是一个用于大型 AI 模型后训练的开源全栈系统。该平台以可验证、可定制的组件为核心设计强化学习流程,提供基于 SGLang 的 rollout 引擎、支持 NVIDIA Megatron-LM 和 PyTorch FSDP 的训练器,以及适应不同部署拓扑的三种权重同步方式。系统支持全参数 RL、LoRA RL、on-policy 蒸馏、监督微调,以及 rollout 与训练之
京东云表示,已与摩尔线程等合作伙伴打造国产AI加速器大规模集群,并规划建设10万卡设施。公司还公布了1,000万小时人类数据采集行动的进展,以及覆盖多模态模型、世界模型和具身模型的JoyAI基础模型矩阵。摩尔线程称,规划中的AI工厂将用于大模型和智能体训练,并支持具身智能应用。目前,10万卡AI工厂仍属于规划项目,并非已经投入运营的设施。