Abra:扩展图像扩散模型训练规模
一项系统性研究利用 Abra(一系列受控的流匹配 Transformer),分析文本生成图像扩散模型的扩展规律。研究使用 10^19 至 10^22 FLOPs 的计算量训练模型,覆盖三个数量级。结果显示,扩散模型与语言模型一样,能够以可预测的方式扩展,但要实现最优训练,需要更多数据:每个参数约需 200 个图像 token,约为语言模型 Chinchilla 计算最优建议的十倍。与语言模型不同,
AI 新闻中心 过去7天分析了 921 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项系统性研究利用 Abra(一系列受控的流匹配 Transformer),分析文本生成图像扩散模型的扩展规律。研究使用 10^19 至 10^22 FLOPs 的计算量训练模型,覆盖三个数量级。结果显示,扩散模型与语言模型一样,能够以可预测的方式扩展,但要实现最优训练,需要更多数据:每个参数约需 200 个图像 token,约为语言模型 Chinchilla 计算最优建议的十倍。与语言模型不同,
ASI-Bench是一项用于评估AI系统能否在有限人类指导下开展科学研究并创造新知识的新基准。该基准涵盖11个科学领域的60项项目级研究任务,并逐步减少人类提供的方法指导。在对18种先进代理与模型配置的测试中,系统在获得完整方法指导时的平均得分为50.91;当必须自行选择研究方法时,得分降至26.62。结果表明,当前AI系统仍高度依赖人类指导,距离自主完成端到端的科学研究还有明显差距。ASI-Be
宇树科技在中国A股市场上市,开盘报每股1100元,较150.80元的发行价上涨629.44%。每一中签单位的收益达到约47.46万元,公司市值升至约4449亿元。宇树科技开发四足机器人和人形机器人,并称自己是高性能通用机器人领域的全球领先企业。公司上半年实现营业收入11.52亿元,同比增长48.54%;但扣除非经常性损益后的归母净利润为2.44亿元,同比下降19.34%。
美国移民与海关执法局(ICE)禁止员工在联邦工作场所佩戴 Meta 智能眼镜。该机构在政策备忘录中表示,这类设备能够隐蔽录制视频和音频,可能无意中捕捉或传输敏感信息。禁令适用于所有 ICE 员工,而不仅是执法人员。Meta 智能眼镜配备摄像头和麦克风,较新版本还加入了 AI 助手,以及只有佩戴者能够看到的微型显示屏。法院、商店和餐厅也开始限制这类设备的使用。隐私组织同时反对未来在智能眼镜中加入人脸
Perplexity通过印度电信运营商Airtel免费提供12个月的Pro订阅,推动下载量和月活跃用户快速增长。报道援引Sensor Tower数据称,其月活跃用户一度达到约2200万。免费兑换期结束后,下载量下降超过90%,但活跃用户规模仍显著高于促销前水平。应用内购买和订阅收入也出现增长。分析人士提醒,部分收入可能来自未及时取消的自动续费,或来自受活动曝光吸引的新付费用户,并不一定代表原免费用
据彭博社报道,Temporal Technologies 正在洽谈一轮约 5 亿美元的新融资。若交易达成,这家开源编排平台开发商的估值可能超过 120 亿美元。目前该轮融资尚未最终确定。
研究人员提出多字节预测方法,以加快字节级层次化语言模型的推理速度。该方法能够并行生成多个字节,无需增加额外参数,同时对模型性能的影响较小。它采用与模型潜在片段对齐的可变长度预测窗口,并设计了新的注意力掩码机制,在支持并行字节预测的同时保持因果性。在文本生成、指令遵循、问答、摘要和机器翻译等任务上的评估显示,该方法在性能与推理吞吐量之间实现了较好的权衡。
论文提出 Agentic ESOpt,使用进化策略(ES)替代传统强化学习,微调需要长期交互的 LLM 智能体。ES 可以在接近推理阶段的 GPU 显存占用下优化模型全部参数,从而避免沉重的反向传播训练流程,以及长轨迹中的奖励归因难题。该方法在当前模型参数附近采样扰动,评估生成智能体的奖励,并执行在线奖励加权更新;同时通过参数与上下文的协同演化提升适应能力。为平衡探索与适应,方法还采用扰动尺度的余
智谱已正式上线 GLM-5.3 API。公司称,该模型擅长复杂编码、防御性网络安全和长程任务,并在 Artificial Analysis Intelligence Index 中获得 60 分,进入前沿模型能力区间,位列开源模型前列。不过,这些性能对比主要依据智谱公布的评测结果。API 定价与 GLM-5.2 保持不变。智谱表示,性能提升主要来自后训练,基础模型与上一代相同。GLM-5.3 已接
Cerebras发布了新一代WSE-3 Turbo芯片及基于该芯片的CS-4系统。公司称,与上一代CS-3相比,CS-4的词元容量提升10倍、速度提升2倍。WSE-3 Turbo集成90万个核心和44GB片上SRAM,FP16稀疏AI算力、内存带宽、片上互联带宽和I/O带宽均提升一倍。单个CS-4系统最多可集成3块WSE-3 Turbo。Cerebras宣称,CS-4在OpenAI GPT-OSS
安全公司 Varonis 研究人员披露,微软 Copilot 存在可通过特制 URL 绕过用户确认的漏洞。攻击者在链接中加入“?autorun=1”和“?q=”参数后,受害者在已登录状态下点击链接,Copilot 可能会自动执行攻击者注入的提示词。该提示词可要求 Copilot 搜索 Gmail 等已连接应用,获取邮件地址、密码或其他凭据,并将结果发送到攻击者控制的服务器。数据还可在传输前转换为
日本芯片设计服务商 Socionext 宣布,将采用英特尔代工的 Intel 18A-P 工艺开发一系列定制 SoC,面向数据中心、边缘计算和高性能计算市场。首个项目将是一款 HPC 芯片。Socionext 将结合自身的 ASIC 技术与英特尔代工的先进制程和封装技术,为特定工作负载打造优化方案。双方尚未公布详细技术规格或量产时间表。
科技公司正通过举办倾听会、承诺提供就业岗位和投入巨额资金,争取公众支持建设其人工智能基础设施所需的数据中心。
据知情人士透露,原xAI多模态负责人林旭东已加入腾讯,担任混元多模态内容生成算法负责人。林旭东曾在哥伦比亚大学攻读博士,研究方向包括表征学习、视频分析和生成模型,并在腾讯、Facebook AI和谷歌实习。加入谷歌DeepMind后,他参与了Gemini的多模态预训练与后训练。腾讯近期持续调整混元团队并引入多名AI研究人员,显示多模态能力可能成为后续重点布局方向。不过,目前尚无独立来源确认此次任命
阿里巴巴推出新的AI超级节点,通过公有云按小时出租。该系统完全采用中国芯片打造,规模小于用于对比的竞争系统。目前,这项服务仅在中国一个偏远省份提供。