小鹏将 Master Agent 引入车辆,第二代 VLA 推出全新版本
小鹏发布了第二代 VLA 模型的全新版本。首次推出的 Master Agent 基于小鹏自研的 Omni 全模态模型,将自然语言理解与智能辅助驾驶、车辆控制相结合。它可以把用户意图自动拆解为任务,并协调智驾、底盘、座舱和车身控制等专用 Agent 执行。在演示中,车辆能够根据语音指令靠边停车。新版本还可以理解模糊的语义,例如根据对门店的不完整描述找到目标门店并规划路线。
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
小鹏发布了第二代 VLA 模型的全新版本。首次推出的 Master Agent 基于小鹏自研的 Omni 全模态模型,将自然语言理解与智能辅助驾驶、车辆控制相结合。它可以把用户意图自动拆解为任务,并协调智驾、底盘、座舱和车身控制等专用 Agent 执行。在演示中,车辆能够根据语音指令靠边停车。新版本还可以理解模糊的语义,例如根据对门店的不完整描述找到目标门店并规划路线。
小鹏汽车宣布,搭载第二代 VLA 的 Robotaxi 近日获得广州市智能网联汽车远程测试资质,可在广州一至三级测试道路开展主驾无安全员测试。公司称,新版 VLA 已实现 L2 至 L4 能力贯通,并计划向更多量产车型及海外场景扩展。小鹏还通过 Token 压缩和蒸馏训练,将模型部署到算力更低的平台。上述信息来自企业活动,尚未公布独立的性能验证结果。
Anthropic 为 Claude Cowork 桌面应用加入了独立的内置浏览器。Claude 可以使用它浏览网页、读取内容、点击按钮、填写表单,以及从在线门户提取数据,而不会访问用户现有浏览器中的标签页、书签或保存的密码。该功能将陆续向 macOS、Windows 和 Linux 上的 Pro、Max 及 Team 用户开放,Enterprise 管理员已可为组织启用。用户可以按网站导入登录信
小鹏汽车通用智能中心负责人刘先明表示,第二代视觉—语言—动作(VLA)模型首次将时间维度纳入模型。新推出的 Infini-VLA 长时序架构可记忆此前 30 秒的环境信息,为驾驶判断提供更长的上下文。小鹏还采用流式自回归推理,并宣称端到端响应速度提升 300%,使模型能够在道路状况不断变化时并行完成观察、思考和行动。相关性能数据来自小鹏的企业介绍,报道未提供独立测试或第三方验证。
亚马逊与英伟达将扩大双方的战略合作。亚马逊此前已宣布部署超过100万枚英伟达GPU,据称还计划为AWS数据中心追加200万枚芯片,涵盖未来的Blackwell Ultra、Rubin和Rubin Ultra架构,预计于2027年至2028年部署。双方尚未公布具体财务条款。合作范围还将延伸至CPU、网络硬件、软件、开源模型和机器人平台。AWS计划把英伟达Nemotron模型整合进Bedrock和Sa
千问办公已上线 Qwen3.8-Flash,并向全体用户开放搭载该模型的新标准模式。官方表示,该模式可通过更低的积分消耗和更高的 Token 吞吐效率处理日常办公任务。千问办公计划建立标准模式与高级模式的双模型体系。官方还称,Qwen3.8-Flash采用全新架构,总参数规模达千亿级,并在内部测试中超过 Claude Opus 4.6。企业实测数据显示,标准模式单任务生成速度提升约一倍,Token
一项受控研究比较了 Next-Chunk 推理强化学习与 Mixed SFT。后者是一种更简单的监督微调方法,同时使用无 CoT 数据和长 CoT 数据进行训练。Mixed SFT 在 RLVR 后的性能上限明显更高,而所需训练算力减少了 60 倍以上。这一优势在领域内数学推理和领域外推理任务中均得到体现。研究表明,Next-Chunk RL 的收益可能主要来自更有效地利用无 CoT 数据,而不一
英伟达CEO黄仁勋表示,在许多任务上,人工智能已经可以被视为实现了通用人工智能(AGI),因此传统的AGI里程碑正变得不那么重要。他指出,AI智能体正日益具备自主性,能够执行任务,并通过反复运行持续改进。黄仁勋认为,当前行业更重要的是AI能否完成具有生产力和盈利能力的工作,以及更多算力能否带来更多可产生收入的Token。不过,批评者指出,现有大型语言模型仍存在幻觉、缺乏持久记忆、逻辑理解能力有限等
JoyAI-Echo-1.5 是一套面向长视频和交互式世界的音视频生成系统。长视频版本通过跨镜头记忆和从语音中提取的说话人信息,在多个场景中保持角色外观和声音身份的一致性。世界模型版本将导航输入转换为经过校准的六自由度摄像机轨迹,从而支持不同控制器和视角的交互。研究团队还将双向音视频骨干网络改造成因果式少步生成器,并利用模型自行生成的长短期 rollout 进行训练,以提高长时生成的效率和稳定性。
一项研究分析了在长期编程任务中,于低成本、低能力模型与高成本、高能力模型之间切换的影响。接收模型必须延续另一个模型生成的任务轨迹,包括工具使用和代码修改。对 Claude 和 GPT 模型组合的测试显示,切换到更强模型时,即使传递完整轨迹,也只能弥补不到一半的能力差距,同时带来显著的成本溢价。相比之下,切换到更便宜的模型能实现更有利的成本与质量平衡。最佳的轨迹信息量也取决于切换方向。
阿里旗下千问办公上线最新 Qwen3.8-Flash 模型及全新标准模式。官方称,用户可用更少的 Token 消耗和更高的处理吞吐完成任务。在真实办公场景测试中,标准模式的单任务生成速度据称提升约 100%,平均 Token 消耗减少 75%。官方表示,性能提升来自模型升级、Agent 协同优化,以及针对多步规划、工具选择和上下文压缩的专项调优。千问办公未来将提供标准和高级两种模式,并宣称 95%
该研究提出Video-IFBench,用于评估多模态大语言模型在视频理解过程中遵循指令的能力。基准包含1500个样本、32种任务类型,以及涵盖语义和格式要求的39类约束。研究人员测试了20多个近期模型,结果显示,当前模型在处理包含大量约束、语义要求,或需要根据视频和音频内容选择正确条件分支的复杂指令时,仍然面临明显困难。
阿里云宣布,自2026年8月27日12时(北京时间)起,下调大模型服务平台百炼上的Qwen3.8-Flash使用价格。输入价格将从每单位1.00元降至0.80元,输出价格从3.00元降至2.70元。据介绍,Qwen3.8-Flash是一款支持百万级上下文窗口的多模态模型,可处理超长文档和代码仓库,并用于编程辅助、图文理解及智能体工作流。该模型还兼容OpenAI和Anthropic的接口协议。
一项研究提出了 Gated Recurrent Transformer,通过反复执行共享的 Transformer 核心,并利用更新门调节每次循环。该方法旨在减少每层使用独立参数的需求,同时保留深层模型的功能多样性。在相同计算量下,三层模型达到了与 12 层 GPT-2 Small 基线相当的准确率。在参数和数据预算相同的情况下,更深的循环结构取得了 2.76 的验证损失,优于非循环模型的 2.8
MA-VLA是一种用于多机械臂协同操作的视觉语言动作模型。它将协作行为分解为原子动作,分配给不同机械臂,并支持在新任务中重新组合这些动作。其“Arm Shuffle”训练方法会置换各机械臂的观测、状态和分配动作,从而减少对固定角色的依赖。在包含训练阶段未出现的协作模式的基准测试中,现有先进VLA模型大多失败,而MA-VLA在仿真和真实环境评估中均表现稳定。研究团队已公开代码、模型和数据。