阿里巴巴正在训练 Qwen4 和下一代视频模型,未来模型将扩展至 5—10 万亿参数
阿里巴巴在云栖大会上公布了千问大模型系列的最新进展。据公司介绍,基于新一代架构的 Qwen4 已进入训练阶段,未来 Qwen4.5、Qwen5 等版本将扩展至 5—10 万亿参数。阿里还宣布,下一代视频生成模型将于 11 月发布,重点提升视频时长、可控性,以及人物、场景、镜头和完整叙事的一致性。阿里称,Qwen3.8-Max 能自主搭建部分训练流程、构造数据、设计实验并定位缺陷,在没有人类直接参与
AI 新闻中心 过去24小时分析了 225 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
阿里巴巴在云栖大会上公布了千问大模型系列的最新进展。据公司介绍,基于新一代架构的 Qwen4 已进入训练阶段,未来 Qwen4.5、Qwen5 等版本将扩展至 5—10 万亿参数。阿里还宣布,下一代视频生成模型将于 11 月发布,重点提升视频时长、可控性,以及人物、场景、镜头和完整叙事的一致性。阿里称,Qwen3.8-Max 能自主搭建部分训练流程、构造数据、设计实验并定位缺陷,在没有人类直接参与
小米发布开源 MiMo-V2.6 系列,包含多模态模型 Pro 和 Flash。据小米介绍,MiMo-V2.6-Pro 在金属有机框架(MOF)材料研究中协助检索文献、提出候选方案并分析模拟结果,探索用于吸附 PFAS 的材料设计;研发周期据称从约一个月缩短至两三天。北京大学研究员窦锦虎评价其达到训练有素的博士研究人员水平。小米还称,该模型协助使用 Lean 4 完成了 Li–Yorke 经典论文
苹果零售业务早期负责人罗恩·约翰逊认为,AI代理很难完全取代实体店购物体验。谷歌正通过Universal Commerce Protocol推动AI代理覆盖商品发现、比较和结账流程,OpenAI也在将ChatGPT打造为购物平台。但约翰逊表示,消费者不太可能在未亲自查看、触摸产品的情况下,让AI直接购买高价笔记本电脑。他认为,AI更适合帮助用户搜索信息、比较产品并缩小选择范围,而不是取代人的判断。
估值156亿美元的法律AI独角兽Harvey,据报正因模型调用和API成本飙升而降低对OpenAI与Anthropic的依赖。AI智能体更新后,客户使用量大幅增长,但其毛利率据称从年初约50%降至6月的-50%。随后,Harvey推出了基于中国月之暗面Kimi K3的自研模型,并重构推理架构。公司表示,这些调整已使毛利率恢复为正。Abridge、Decagon、Ramp和Rogo等企业也在开发自有
研究人员提出 Grounded Action Models(GAM),一种将物体三维定位明确融入机器人基础模型的方法。语言、点和框提示会被转换为统一的以物体为中心的表示,其中包含面向目标的视觉特征和可度量的物体几何信息,再由多流 Transformer 与机器人状态历史结合,预测动作片段。GAM 在 RoboTwin 2.0 的 50 项任务中取得 55.3% 的平均成功率,在 LIBERO-PR
研究人员推出 VideoGen-Agent,这是一种通过多任务智能体强化学习训练、能够协调外部视频生成工具的多模态智能体。该系统在多轮交互中使用增强、生成和验证工具,以应对专业知识、特定身份保持、物理一致性、场景构图和事件顺序等问题。在包含600个提示的全新 VABench 基准测试中,VideoGen-Agent 将基础文本生成视频模型的得分从56.5提升至75.6。升级生成工具后,无需额外训练
Jev-Mem 是一种面向长期运行 AI 智能体的记忆架构。它将快速、轻量的控制与较慢且成本更高的审慎推理分开。System One 控制器负责记忆分类和关系组织、查询路由、检索预算分配、图遍历、候选评分以及自适应停止检索。System Two 仅在需要复杂推理和答案合成时启用。在 LoCoMo 基准测试中,Jev-Mem 的 LLM-as-a-Judge 得分为 0.777,相比最强基线相对提升
GameHorizon Suite是一套用于评估电子游戏中AI模型能力的数据集和基准。它衡量视觉理解、指令分解、目标规划,以及跨越短期和长期时间尺度的精确动作控制。该套件包括自动化标注流程、由100名资深玩家在21款AAA游戏中收集的5,000小时游戏记录,以及在时间上对齐的视频、玩家动作和多时间尺度指令。基准同时支持可复现的离线测试和逐步在线评估。研究团队对47个模型进行了超过100万次模型调用
研究人员提出一种方法,在部署时无需进行高成本的未来模拟,就能将世界模型对物理场景的理解迁移到紧凑型视觉-语言-动作(VLA)策略中。训练期间,系统使用冻结的世界模型处理训练帧并缓存其特征,再将特征对齐作为额外训练目标。训练完成后移除教师模型,因此部署策略的运行成本与基线模型相同:在消费级 RTX 5090 上,每次决策耗时 32 毫秒,占用 1.86GB 内存。一个拥有 8 亿参数的学生模型在 L
龙芯发布了面向自研 LG200 通用 GPU 的龙芯加速计算平台首个软件版本。平台覆盖底层驱动、编译器、运行时环境、资源管理、BLAS 和 DNN 算子库、调试与性能分析工具,以及 LacInfer 推理引擎,支持 OpenCL 3.0、CUDA 兼容编程接口和 ONNX Runtime。用户可将 PyTorch、TensorFlow 导出的 ONNX 模型直接部署到龙芯 GPU,无需额外转换或重
阿里巴巴旗下芯片部门平头哥发布了人工智能加速器 Zhenwu V900。公司称,该产品性能是上一代的三倍,并可扩展至由最多 50 万颗芯片组成的集群。阿里巴巴将其称为中国性能最强的 AI 芯片,并将其定位为英伟达的竞争产品。相关性能数据及大规模部署能力仍有待独立验证。
腾讯控股发布了一款新的图像生成模型,旨在加强其在中国竞争激烈的AI市场中的地位。该模型发布当天,竞争对手阿里巴巴启动了AI大会,显示腾讯希望追赶字节跳动等行业领先企业。目前尚未公布具体的技术基准或独立性能评估结果。
HuRo研究将人类活动视频机器人化后,能否作为视觉—语言—动作(VLA)模型预训练的可扩展监督数据。研究团队开发了一套流程,将不同来源的人类视频转换为与机器人对齐的观测数据和动作轨迹,并推断缺失的中间信号。由此构建的数据集包含约63万条机器人化片段,以及来自五个人类视频来源的1.42亿个处理帧。在四项真实世界操作任务中,增加机器人化预训练数据后,整体完成率从51.5%提升至80.3%;在空间和视觉
WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实
RRSI是一种自动改进基于大语言模型的智能体系统的方法,涵盖提示词、控制流程、工具、记忆和上下文管理。该方法旨在缓解过拟合问题,即系统在用于优化的任务上取得明显提升,却难以迁移到未见过的基准测试。RRSI限制每个候选方案可合并的修改数量,鼓励探索尚未尝试的改进路径,并通过批评器和剪枝器过滤特定于基准、成本过高或已失去作用的修改。在涵盖编程、智能体工作空间和工程设计的八项基准测试中,RRSI在优化数