SAS:通过端到端优化上下文排序实现简单注意力稀疏化
SAS 是一种面向预训练 Transformer 的稀疏注意力方法,通过语言模型损失直接优化上下文选择。与仅根据密集注意力权重对 token 或区块进行排序的方法不同,SAS 在训练期间将选择器的连续分数注入注意力 logits,使其能够通过标准反向传播进行更新。该方法在注意力 softmax 内使用对数形式的门控,并通过归一化门控平衡历史上下文与始终保留的当前区块。研究团队还实现了节省内存的 T
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
SAS 是一种面向预训练 Transformer 的稀疏注意力方法,通过语言模型损失直接优化上下文选择。与仅根据密集注意力权重对 token 或区块进行排序的方法不同,SAS 在训练期间将选择器的连续分数注入注意力 logits,使其能够通过标准反向传播进行更新。该方法在注意力 softmax 内使用对数形式的门控,并通过归一化门控平衡历史上下文与始终保留的当前区块。研究团队还实现了节省内存的 T
机器人基础模型在训练分布内通常表现良好,但遇到视觉分布变化时性能容易下降。研究提出潜在接口训练(LIT),旨在减少模型对“视觉—动作捷径”的依赖,即利用与任务无关、却在训练数据中与动作相关的视觉线索。第一阶段不使用图像,让动作专家根据语言、机器人状态以及示范动作片段的末端执行器终点位姿,学习生成面向目标的动作序列。第二阶段引入经过位姿监督的潜在接口,融合视觉和语义表示,并作为动作专家唯一的视觉条件
vLLM-Omni、通用 H3 服务架构与 FastH3 组成的优化方案,针对 MiniMax H3 视频生成部署中的端到端延迟进行系统改进。方案涵盖长序列注意力与通信优化、融合 DiT 算子、并行 VAE 解码、紧凑输出传输和并行 MP4 构建等。在 8 卡 B300 测试中,完整响应延迟较 Diffusers 降低 30.8%。FastH3 还将 DiT 前向计算次数从 49 次减少至 4 次
微软9月12日宣布将SpaceXAI的Grok模型引入Microsoft 365 Copilot。目前,该模型作为Microsoft Frontier项目的有限预览功能,面向部分客户在Word、Excel和PowerPoint中提供,微软将评估其处理常见办公任务的实际效果。继整合Anthropic的Claude模型后,此举显示微软正减少对OpenAI单一供应商的依赖,转向多模型架构。SpaceXA
Anthropic CEO达里奥·阿莫代伊呼吁放缓前沿AI模型开发,并推动独立监控与全球监管。xAI创始人马斯克和OpenAI CEO奥尔特曼表示支持;奥尔特曼称,OpenAI也将向独立第三方开放模型评估权限。智谱宣布完成约50亿美元融资,其中约20亿美元来自股份配售,约30亿美元来自可转债,资金将用于下一代GLM基础模型研发等。相关信息来自企业公告和媒体报道,并不意味着全球监管已经落地,也不代表
微软正在扩大 Microsoft 365 Copilot 可使用的模型范围,将 xAI 的 Grok 引入 Word、Excel 和 PowerPoint。目前,该功能通过 Microsoft Frontier 计划以有限预览形式提供,欧盟、EFTA 成员国及英国的客户暂时无法使用。微软尚未公布具体采用的 Grok 模型。由于部分客户数据在调用 Grok 时可能由 xAI 处理,企业 IT 管理员
微软首席执行官萨提亚·纳德拉表示,公司欢迎为确保人工智能对齐方向正确而采取的审慎推进方式,并宣布为微软 MAI 模型制定行为准则。他指出,任何追求超级智能的行动都必须遵循核心原则:人工智能应当帮助人类,并处于人类控制之下。纳德拉还强调,应加快人工智能带来的收益,并让不同国家和社区广泛受益。
前沿人工智能模型的经济效益似乎开始承压。Anthropic 正准备进行一项可能创下纪录的首次公开募股,但据报道,其部分美国客户正在选择更便宜的模型,而不是该公司的最先进方案。这一变化表明,客户关系和足够的商业价值,可能比模型的最高性能更加重要。
蚂蚁灵波科技进一步开源三款 LingBot-World 2.0 模型:1.3B 参数的 Small、Bidirectional,以及 Causal Pretrain。LingBot-World 2.0 是实时交互世界模型,可连续生成场景,并响应攻击、射箭、施法、射击等角色动作,以及下雨、下雪等环境事件。Small 版本面向消费级单卡 GPU 设计,旨在支持本地实时生成。Bidirectional
此外,报道还涉及苹果的折叠屏 iPhone、一名利用人工智能以数字方式重现父亲的男子、Meta 的新模型 Muse,以及其他最新动态。
中国人工智能公司智谱宣布完成约50亿美元融资,其中约20亿美元来自股份配售,约30亿美元来自可转债发行。资金将主要用于下一代GLM基础模型、完全自训练体系、大规模训练与生产推理,以及算力资源和技术基础设施的建设与升级。智谱表示,完全自训练是让下一代GLM在上一代模型构建的环境中训练,形成递归式自我改进循环。相关投入还包括自动生成和筛选训练数据、构建任务环境、提升长程推理能力,以及进行国产芯片适配、
多位AI行业高管呼吁以更审慎的节奏开发前沿模型,并加强安全评估。Anthropic首席执行官达里奥·阿莫代伊表示,公司将增加包括独立第三方评估在内的安全措施;OpenAI首席执行官萨姆·奥尔特曼和xAI的埃隆·马斯克也表示支持。分析人士预计,芯片厂商及AI相关股票短期可能承压,但不会长期改变AI行业的投资逻辑。算力、能源和基础设施需求仍然强劲。模型研发放缓可能让企业更专注于盘活现有基础设施,同时推
更新后的特斯拉 Model Y 车主手册显示,Grok即将支持通过语音向联系人或电话号码发送短信。目前,Grok已经可以执行导航、拨打电话、播放媒体、查询车辆信息,以及调节空调和座椅加热等车辆功能。特斯拉尚未公布短信功能的上线时间。该功能将允许驾驶员以自然语言口述消息,并保持双手放在方向盘上。它也可能是特斯拉进一步整合Grok、车载系统与FSD计划的一部分。
研究人员开发了CARDEA,这是一种用于端到端分析侵入性冠状动脉造影的大型视觉语言模型。系统能够处理多视角视频、选择关键帧,并评估冠状动脉优势类型和病变复杂程度。其Chain-of-Box方法将推理过程与空间边界框关联起来,使结论依据更易审查。采用可验证奖励的强化学习显著提升了零样本报告生成能力。在复杂程度评估中,CARDEA的准确率达到0.90,与介入心脏病专家相当;在领域变化下也保持了较好的表
DeepSeek正在App内灰度测试AI语音对话功能,部分用户可选择四种音色。与此同时,陶哲轩、彼得·舒尔茨等25位菲尔兹奖得主发表联合声明,警告AI公司与数学共同体之间出现“严重错位”,并对当前AI系统在数学领域的可靠性和研究价值提出质疑。行业预测称,中国年度Token消耗量预计将在2026年达到100亿亿,并在2030年前继续快速增长。微信也在密集测试多项AI功能,包括图片美化、修改和信息提取