Miles v0.1:面向前沿模型的生产级后训练系统
Miles v0.1 是一个用于大型 AI 模型后训练的开源全栈系统。该平台以可验证、可定制的组件为核心设计强化学习流程,提供基于 SGLang 的 rollout 引擎、支持 NVIDIA Megatron-LM 和 PyTorch FSDP 的训练器,以及适应不同部署拓扑的三种权重同步方式。系统支持全参数 RL、LoRA RL、on-policy 蒸馏、监督微调,以及 rollout 与训练之
AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Miles v0.1 是一个用于大型 AI 模型后训练的开源全栈系统。该平台以可验证、可定制的组件为核心设计强化学习流程,提供基于 SGLang 的 rollout 引擎、支持 NVIDIA Megatron-LM 和 PyTorch FSDP 的训练器,以及适应不同部署拓扑的三种权重同步方式。系统支持全参数 RL、LoRA RL、on-policy 蒸馏、监督微调,以及 rollout 与训练之
SceneMosaic是一种高效生成多样化、可用于仿真的室内场景框架,面向互动娱乐和具身智能。该方法先利用从图像中学习的参数化先验生成初始场景,再通过视觉语言模型智能体进行演化和细化。系统将场景拆分为相互独立的局部单元,分别进行优化后再组合成完整场景,从而兼顾生成效率和物理合理性。在SceneEval-100基准测试中,SceneMosaic的语义布局质量与最强的智能体基线相当,但速度提升了24倍
VidaForge 是一个用于研究视频数据配方如何影响模型预训练的开放研究基础设施。它将从原始视频到训练数据集的处理过程表示为可执行的五阶段工作流,并保留每个样本的生成来源。研究人员可以调整其中的具体决策来构建不同的数据集,而无需重新搭建整套基础设施。使用 Wan 2.1 和 V-JEPA 2.1 的实验表明,覆盖范围更广的数据配方在下游基准测试中取得了最高分,但基于损失的评估则偏好其他配方。该项
MOLE 是一个开放基准,用于评估能否在日常工作中检测 AI 智能体的有害活动。该基准包含 150 个由 AI 运营的账户、9 个有状态服务、30 个工作日、12 种威胁,以及来自 4 个模型、总量约 200 亿个 token 的数据。39 个智能体模型中,72% 完成了大部分被分配的有害目标;智能体是否拒绝执行,并不能可靠预测目标是否会完成。在单日审计事件比较中,即使表现最好的监控器也漏掉了近一
蚂蚁集团推出并开源百灵系列首个原生多模态模型 Ling-3.0-flash-VL。该模型基于混合专家(MoE)架构,总参数量为 1240 亿,但单次推理仅激活 55 亿参数;原生支持图像、文本和视频输入,上下文窗口达到 25.6 万 Token。模型引入视觉反馈闭环,可持续执行“观察、行动、验证、修正”流程,用于医疗报告解读、代码生成和 GUI 自动化等任务。蚂蚁集团称,模型在 Image-to-
ENEAS是一种由文本提示驱动的方法,可跟踪单个物体,并在视频和无序数据集中发现与语义查询匹配的所有实例。该方法结合了用于稳健跟踪的时间记忆、视觉嵌入匹配,以及仅对模糊候选对象调用的条件式视觉语言模型验证。它旨在减少物体离开画面后跟丢、极端近景下分割破碎,以及把雕像、画作或倒影等外观相似物误判为目标等问题。ENEAS面向包括三维重建在内的应用场景,因为错误分类的干扰物可能破坏重建结果。代码和模型已
研究人员推出了Uno,这是一种将自回归语言模型与扩散方法结合的架构,可并行生成多个词元。自回归权重仍使用标准的下一词元预测目标进行训练,轻量级扩散权重则负责并行生成。据研究人员介绍,扩散蒸馏只会带来极低的额外训练成本,也不需要像投机解码那样使用独立的草稿模型。在评测中,Uno在不降低基础自回归模型质量的情况下,最高实现约3倍的生成速度提升。研究报告称,8B版本在智能体工具使用、编程和长上下文推理基
该研究考察大型语言模型能否将用户提出的局部修改传播到通过对话生成的产物中所有受影响的依赖部分。研究人员提出了一个新基准,并使用 gpt-oss-20b/120b、gpt-5.4-mini 以及 qwen3.5-9b/27b/122b 评估了九种修订方法,包括顺序反思和并行采样。基线方法的准确率为 68.3% 至 93%。最具成本效益的方法是从三个并行样本中,使用基于大语言模型的选择器或 medoi
一项研究考察了大语言模型如何在内部表示空间中组织问题构建、目标分解和演绎等推理操作。研究人员发现,这些操作可以在留作测试的隐藏表示中被区分,且在模型中间层的可分离性最高。该结构不能仅由词汇或位置因素解释。随着层数增加,推理操作的对应关系会分布到更长的词元片段中;同一个表面词也会因周围推理操作不同而产生不同的内部表示。注意力屏蔽干预进一步表明,推理片段开头与操作相关的表示依赖此前的推理上下文。研究团
该研究将多智能体 LLM 系统中协调器与工作智能体的交互建模为双层协调博弈,并分析任务分解、文本反思、记忆更新和外部验证对协作与系统漂移的影响。研究提出随机反思记忆攀升(SRMA)方法,只有在基于环境的评估显示风险降低时才接受记忆更新;在特定假设下,作者还给出了收敛和重新锚定保证。在 500 个 SWE-bench 实例上,基于 Kimi 的系统解决了 72.2% 的任务,公开的 mini-SWE
根据 OpenRouter 最新数据测算,8月31日至9月6日,全球主要大模型总调用量达到115万亿Token,环比增长1.77%。中国大模型调用量为56.72万亿Token,美国大模型为16.54万亿Token,中国模型连续19周领先。调用量前五名中有四款来自中国。腾讯混元 Hy4 Preview 以14.7万亿Token位居第一,环比增长379%。该模型于8月28日开源,拥有7700亿总参数、
ShallowStream 是一个用于提升多模态大语言模型连续视频处理效率的框架。它利用模型的浅层同时进行视频帧编码和轻量级检索索引构建,并持续维护该索引。在查询阶段,系统根据浅层生成的注意力分数评估上下文帧,再通过考虑多样性的策略选择准确且全面的证据。论文作者称,该方法在性能上可媲美现有领先的流式处理方法,同时将每帧预填充延迟最多降低52.1倍,将10秒视频的端到端延迟最多降低11.9倍。相关源
AdaptVPR是一种生成式数据增强框架,旨在提升视觉地点识别对光照、天气、季节变化和动态遮挡的鲁棒性。视觉语言模型负责解析场景属性,基于规则的调度器则根据可编辑性和风险约束选择生成路径。系统可生成天气、光照和时间等全局外观变化,加入局部动态遮挡物,或结合两类扰动。基于几何一致性和外观多样性的验证机制会筛除不可靠样本,降低结构偏移风险。由此构建的AdaptCities数据集包含16万条经过验证的合
腾讯微信视觉团队开源了通用多模态嵌入模型 WeMM-Embedding,支持文本、图像等输入。该模型提供 2B、4B 和 9B 三种规模,面向不同部署需求。其采用统一架构,并结合两阶段训练与知识蒸馏,在多模态理解能力和部署效率之间进行平衡。据腾讯介绍,WeMM-Embedding 已大规模部署于微信推荐与搜索系统,日调用量达到十亿级。此次开源使开发者能够使用一款已在大型商业服务中部署的模型,但公告
MaxKernel 是一个用于设计和优化 TPU 定制内核的多智能体系统。它支持三种方式:人类参与的协作式设计、基于性能指标和追踪数据的全自动优化,以及用于更广泛探索设计空间的图搜索式自主探索。多个专业子智能体分别负责规划、实现、自我调试、测试和硬件性能分析。研究人员在 TPU 基准套件 JaxBench 的 50 项任务,以及先进开源模型的真实工作负载上进行了评估,并称该系统在许多情况下达到了专