马斯克预告 Grok 4.7 将于 2026 年 9 月 12 日上线,称其将超越所有竞品
埃隆·马斯克在 X 平台表示,Grok 4.7 预计将在 10 天后,即 2026 年 9 月 12 日发布。该模型据称拥有 2.1 万亿参数,较 Grok 4.6 的 1.5 万亿增加 40%。马斯克称,除运行速度略慢外,Grok 4.7 在各方面都将优于前代,且 Token 效率更高。他还表示,Grok 4.7 上线后将超越所有其他模型。目前,这些性能说法尚未得到独立基准测试的证实。
AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
埃隆·马斯克在 X 平台表示,Grok 4.7 预计将在 10 天后,即 2026 年 9 月 12 日发布。该模型据称拥有 2.1 万亿参数,较 Grok 4.6 的 1.5 万亿增加 40%。马斯克称,除运行速度略慢外,Grok 4.7 在各方面都将优于前代,且 Token 效率更高。他还表示,Grok 4.7 上线后将超越所有其他模型。目前,这些性能说法尚未得到独立基准测试的证实。
中国 AI 模型开发商智谱 AI 已在天猫开设官方旗舰店,销售基于 GLM-5.3 的 GLM Coding Plan 订阅服务,支持 ZCode、Claude Code、Codex 等 20 多款主流 Agent。个人版 Lite、Pro、Max 月费分别为 118 元、538 元和 1078 元,团队版标准席位为每席每月 598 元。服务支持按月、季、年订阅。智谱还表示,未来用户可通过电商平台
阿里发布 Qwen3.8-Max-0902,针对编程和专业办公任务进行了进一步后训练。官方称,新版本更适合企业复杂任务、科研以及长周期工作流程。根据 CodeArena 数据,该模型在前端编程总榜中的分数提升 22 分至 1691 分,排名第一。阿里还表示,模型在智能体编程、多步推理、工具调用和端到端应用生成方面均有所提升。CodeArena 更新的性价比榜单显示,Qwen3.8-Max-0902
Safin-1是一系列旨在将安全能力直接融入模型内部计算的基础模型,而不是完全依赖外部防护机制或训练后的对齐。其核心架构MARCH(Memory-Anchor Routing across Context History)维护结构化记忆状态,并从历史上下文中选择性检索相关信息。持久化的能力状态可以在测试时进行调整,无需反复修改模型主干,从而支持受控的专门化。使用专门Safety State的实验显
DiagEvo是一种语言模型自我进化方法,能够从求解器自身的失败历史中分析反复出现的错误原因。分层记忆按技能节点组织这些原因,并将其标记为“活跃”或“已掌握”。系统据此生成针对特定错误的题目,同时保留自由探索机制。双重置信度过滤器只有在最常见答案具有明显票数优势时,才保留中等难度题目。使用4B诊断模型时,DiagEvo在Qwen3-4B、Qwen3-8B和OctoThinker-8B上的九项基准测
一项研究在混合专家(MoE)架构中评估循环式 Transformer。这类模型通过重复执行共享层块来增加有效深度,但研究在比较时匹配了每个 token 的计算量、非嵌入参数总数和 KV 缓存。研究人员提出 SMELT,让中间一半的层重复执行两次。在最大达到 540 亿个非嵌入参数的四种模型规模上,SMELT 随计算量增加呈现更快的损失下降,并在计算最优前沿节省 6.8% 至 18.0% 的训练 F
该论文提出 Harness-of-Harness(HoH),一个面向大语言模型编程代理的框架。HoH 将现有代理运行环境组织为反复执行的规划、编码和测试循环,在修复问题与扩展能力之间取得平衡,并将开发拆分为可验证的小步骤,分离实现阶段测试与独立评估,同时保留带版本记录的项目历史。研究人员报告称,在 GameCraft-Bench、FrontierSWE 和 ProgramBench 上,经过三次迭
Qwen-Drive-1.0是一款面向自动驾驶的视觉语言模型,将三维感知、视觉问答和运动规划统一到同一框架中。外部鸟瞰视角(BEV)感知头负责三维目标检测、语义占用预测和BEV地图分割,并为三维场景结构提供可检查的接口。规划模块基于共享的视觉语言模型表示生成车辆未来轨迹。分阶段训练方案结合驾驶监督数据与通用视觉语言数据,在培养驾驶能力的同时,尽量保留广泛的视觉理解和指令遵循能力。多种开放环、伪闭环
E-Commerce Bench 是一个开源基准,用于评估大语言模型智能体在动态年度商业模拟中的表现。智能体需要同时运营多家网店,开展市场调研,与供应商谈判,优化销售策略,处理订单和退货,并管理现金流。模拟环境包括促销活动、自然灾害和供应链冲击。研究团队从七个维度评估了18个前沿模型,结果显示没有任何模型在所有领域都占据优势。GPT-5.6 Sol 将10万初始资金增至1,431,425,期末资产
ZimaBlue是一种利用大规模第一视角视频训练机器人世界动作模型的框架。其三阶段训练流程首先从人类和机器人视频中学习因果具身视觉动态,随后通过统一的动作表示将这些表征与异构机器人轨迹结合,最后针对目标机器人进行专门化。异步Slow-Fast架构将高容量Slow世界模型与轻量Fast分支结合,可在NVIDIA RTX 4090上以30 Hz进行动作预测。在真实机器人零样本评估中,相比仅使用目标机器
H3-World是一种高效框架,可将拥有330亿参数的MiniMax-H3视频生成模型转化为交互式世界模型。该系统无需引入专用动作模块,即可通过自然语言指令更精确地控制角色行为和摄像机运动,并实现时间层面的控制。系统将每个动作表示为角色指令与摄像机指令的结构化组合,并与对应时间段的视频潜在表示对齐。时间注意力路由会将每条指令限制在指定时间区间内,从而减少不同动作之间的控制干扰。使用8,000个游戏
该研究评估多模态大语言模型直接进入无人机控制回路后的表现。研究提出DroneCATS-Agent架构和DroneCATS基准,测试四项能力:接近可见目标、跟踪移动目标、搜索初始视野之外的区域,以及指挥多架无人机。模型无需微调,也不依赖预先定义的函数调用模式。结果显示,即使是简单的具身任务,目前模型仍远未达到可靠水平。小型开源模型有时比前沿模型更稳定地飞入目标范围,但经常过早宣布到达,或始终不宣布到
据《华尔街日报》报道,谷歌最早可能于当地时间周三发布新模型 Gemini 3.8 Flash,内部代号为“Skimaki”。谷歌编程工具 Jetski 的内部对比测试据称显示,工程师对 Gemini 3.8 Flash 的偏好超过 Anthropic 的 Opus,表明谷歌在编程能力上缩小了与 Anthropic 和 OpenAI 的差距。不过,相关结论仅来自内部测试,尚未经过独立验证。Flash
据《The Information》报道,OpenAI 即将推出的 Astra 模型采用了名为“recurrent depth”的技术,可能提升成本效率和性能。但这种方法也会让模型的推理过程更难检查和监控。OpenAI 表示,Astra 在编程以及操作电脑应用程序等方面的能力将有所增强。
ReFlowSET是一种条件潜在流匹配方法,用于将合成孔径雷达(SAR)观测数据转换为电光(EO)图像。与通常依赖自然图像预训练自编码器的现有方法不同,该方法通过联合评估SAR输入和EO目标的重建效果来选择潜在编解码器。随后,它在选定的潜在空间中从头训练一个规模显著更小的条件DiT模型。训练过程中,带噪声的EO特征会与冻结视觉基础模型提取的干净表征进行对齐,但不会增加推理成本。在QXS-SAROP