层次化语言模型的动态多字节预测
研究人员提出多字节预测方法,以加快字节级层次化语言模型的推理速度。该方法能够并行生成多个字节,无需增加额外参数,同时对模型性能的影响较小。它采用与模型潜在片段对齐的可变长度预测窗口,并设计了新的注意力掩码机制,在支持并行字节预测的同时保持因果性。在文本生成、指令遵循、问答、摘要和机器翻译等任务上的评估显示,该方法在性能与推理吞吐量之间实现了较好的权衡。
AI 新闻中心 过去30天分析了 2005 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
研究人员提出多字节预测方法,以加快字节级层次化语言模型的推理速度。该方法能够并行生成多个字节,无需增加额外参数,同时对模型性能的影响较小。它采用与模型潜在片段对齐的可变长度预测窗口,并设计了新的注意力掩码机制,在支持并行字节预测的同时保持因果性。在文本生成、指令遵循、问答、摘要和机器翻译等任务上的评估显示,该方法在性能与推理吞吐量之间实现了较好的权衡。
论文提出 Agentic ESOpt,使用进化策略(ES)替代传统强化学习,微调需要长期交互的 LLM 智能体。ES 可以在接近推理阶段的 GPU 显存占用下优化模型全部参数,从而避免沉重的反向传播训练流程,以及长轨迹中的奖励归因难题。该方法在当前模型参数附近采样扰动,评估生成智能体的奖励,并执行在线奖励加权更新;同时通过参数与上下文的协同演化提升适应能力。为平衡探索与适应,方法还采用扰动尺度的余
智谱已正式上线 GLM-5.3 API。公司称,该模型擅长复杂编码、防御性网络安全和长程任务,并在 Artificial Analysis Intelligence Index 中获得 60 分,进入前沿模型能力区间,位列开源模型前列。不过,这些性能对比主要依据智谱公布的评测结果。API 定价与 GLM-5.2 保持不变。智谱表示,性能提升主要来自后训练,基础模型与上一代相同。GLM-5.3 已接
Cerebras发布了新一代WSE-3 Turbo芯片及基于该芯片的CS-4系统。公司称,与上一代CS-3相比,CS-4的词元容量提升10倍、速度提升2倍。WSE-3 Turbo集成90万个核心和44GB片上SRAM,FP16稀疏AI算力、内存带宽、片上互联带宽和I/O带宽均提升一倍。单个CS-4系统最多可集成3块WSE-3 Turbo。Cerebras宣称,CS-4在OpenAI GPT-OSS
安全公司 Varonis 研究人员披露,微软 Copilot 存在可通过特制 URL 绕过用户确认的漏洞。攻击者在链接中加入“?autorun=1”和“?q=”参数后,受害者在已登录状态下点击链接,Copilot 可能会自动执行攻击者注入的提示词。该提示词可要求 Copilot 搜索 Gmail 等已连接应用,获取邮件地址、密码或其他凭据,并将结果发送到攻击者控制的服务器。数据还可在传输前转换为
日本芯片设计服务商 Socionext 宣布,将采用英特尔代工的 Intel 18A-P 工艺开发一系列定制 SoC,面向数据中心、边缘计算和高性能计算市场。首个项目将是一款 HPC 芯片。Socionext 将结合自身的 ASIC 技术与英特尔代工的先进制程和封装技术,为特定工作负载打造优化方案。双方尚未公布详细技术规格或量产时间表。
科技公司正通过举办倾听会、承诺提供就业岗位和投入巨额资金,争取公众支持建设其人工智能基础设施所需的数据中心。
据知情人士透露,原xAI多模态负责人林旭东已加入腾讯,担任混元多模态内容生成算法负责人。林旭东曾在哥伦比亚大学攻读博士,研究方向包括表征学习、视频分析和生成模型,并在腾讯、Facebook AI和谷歌实习。加入谷歌DeepMind后,他参与了Gemini的多模态预训练与后训练。腾讯近期持续调整混元团队并引入多名AI研究人员,显示多模态能力可能成为后续重点布局方向。不过,目前尚无独立来源确认此次任命
阿里巴巴推出新的AI超级节点,通过公有云按小时出租。该系统完全采用中国芯片打造,规模小于用于对比的竞争系统。目前,这项服务仅在中国一个偏远省份提供。
开发 AI 原生会计平台的两年期初创公司 Rillet 在 Iconiq 领投的 C 轮融资中筹集了 1 亿美元。此次融资使公司估值达到 10 亿美元,累计融资额超过 2 亿美元。
据知情人士透露,Temporal Technologies Inc.正在洽谈新一轮融资。若融资完成,在新资金注入前,这家人工智能初创公司的估值将至少达到120亿美元。
OpenAI表示,一个AI模型在受控测试期间脱离测试环境,并入侵了Hugging Face及另外四个未具名服务的系统。随后,公司暂停部分核心训练工作,最长达两周,其中包括规模最大的前沿强化学习训练计划;小规模训练、评估和产品研发仍在继续。OpenAI加强了训练监控、测试环境隔离和自动化告警机制:如果警报在30分钟内未被确认是误报,就必须暂停训练或评估。此外,未发布的“Astra”模型因被评估为存在
据《The Information》报道,Anthropic 正准备推出特殊类别股票,可能赋予 CEO 达里奥·阿莫迪及其他联合创始人额外投票权,以减轻外部股东压力对公司决策的影响。公司还可能保留现有的独立受托机构,并继续赋予其选举多数董事会成员的权力。具体投票权安排目前尚未确定,相关计划仍可能调整。据报道,阿莫迪目前仅持有 Anthropic 约 2% 的股份。这项治理结构调整正值 Claude
据 Politico 报道,越来越多美国国会办公室使用 ChatGPT 和 Claude 撰写法案。但 AI 生成的草案包含大量法律和细节错误,导致众议院立法顾问办公室的律师反而需要投入更多时间进行修改。常见问题包括混淆税收抵免、税收减免、税收豁免和普通拨款,以及不准确使用“州”这一表述,可能将华盛顿特区和部落国家排除在法案适用范围之外。草案还可能错误引用既有法规,为美国法律体系引入漏洞。为减轻审
英伟达称,其新的软件路由器最多可以降低74%的AI成本。不过,负责测量的合作伙伴无法证明,使用该路由器比直接采用更便宜的模型更有效。