OpenAI称模型训练调整将增加相当于推理工作量20%的计算开销
OpenAI表示,模型训练流程的调整将使计算开销增加,增幅相当于目前观测到的推理工作量的20%。其中一个原因是扩大对前沿模型思维链过程的多阶段监控。OpenAI称,这部分新增成本不会转嫁给客户。
AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI表示,模型训练流程的调整将使计算开销增加,增幅相当于目前观测到的推理工作量的20%。其中一个原因是扩大对前沿模型思维链过程的多阶段监控。OpenAI称,这部分新增成本不会转嫁给客户。
GS-Voxel 是一个用于大规模 3D Gaussian Splatting(3DGS)场景生成的结构化潜变量框架。它能将无序、空间不规则且经过预优化的 3DGS 重建确定性地转换为稀疏活动体素,无需针对每个场景进行额外优化,同时保留所选图元的位置和渲染属性。分解式 VAE 分别编码体素几何结构与局部高斯属性。随后,图像条件流模型根据卫星视角图像生成航空 3DGS 场景。通过考虑重叠区域的分块推
该研究提出了一套以能力为导向的数据基础设施,用于训练通用图像生成模型。系统将文本—图像对齐、图像变换和图像—知识关联等专门监督数据结合起来,并按照能力之间的依赖关系,逐步调整任务组合、视觉概念分布、数据质量和图像分辨率。该基础设施包含4.4亿张文生图图像、1.2亿组编辑数据对,以及超过2,700万组图像—实体数据对。研究人员基于这些数据从头训练了30亿和60亿参数的扩散模型,并通过CPI-Benc
一项研究使用 AI-Infra-Guard 评估 DeepSeek Harness(DSH)抵御间接提示注入攻击的能力。研究覆盖 16 个间接内容渠道、文本和文件载体、35 个攻击目标及 12 种攻击方法,共进行了 14,560 次受控执行。研究保留了 DSH 的智能体循环、工具注册、模型适配器和会话事件路径,并通过本地测试工具避免外部副作用。观察到的最高攻击成功率分别为:文本模式下的虚假完成攻击
研究人员提出 RUPA,用于量化大语言模型智能体在完整执行轨迹中的不确定性。该方法不再仅依赖词元概率、预测熵或单步置信度等局部信号,而是将推理状态、工具交互和环境反馈之间的依赖关系表示为有向轨迹图,并在图中传播不确定性,以捕捉执行风险的累积和转移,从而更早发现失败。研究团队使用 6 个开源大语言模型,在 τ-2、Terminal-Bench-2 和 GAIA 基准上进行评估。结果显示,RUPA 的
该论文提出了 aDSL,一种面向程序化三维创作的代理中心型领域专用语言,并配套开发了按角色分工的多代理系统。代理不再依赖容易出错的绝对坐标,而是使用表达空间关系的关系运算符来操作几何结构。无需额外训练的“规划—执行—批评”流程会拆解用户请求、生成代码,并根据执行反馈修复错误和约束违规。实验表明,与既有基于大语言模型的方法相比,该方法在文本生成形状和图像生成形状任务中提升了鲁棒性、可控性以及对用户意
StartupBench是一项评估AI智能体执行完整真实工作流程能力的基准测试。它不主要依赖研究人员挑选的任务,而是以已证明拥有用户采用率和实际需求的AI产品为基础,覆盖多个专业领域。研究人员将这些工作流转化为面向交付成果的任务,并通过细致的评分标准进行评估。即使是测试中表现最强的模型,也只能完整完成约30%的任务,尽管在许多任务上取得了明显的部分进展。复杂指令遵循和领域专业知识不足是主要失败原因
一项系统性研究利用 Abra(一系列受控的流匹配 Transformer),分析文本生成图像扩散模型的扩展规律。研究使用 10^19 至 10^22 FLOPs 的计算量训练模型,覆盖三个数量级。结果显示,扩散模型与语言模型一样,能够以可预测的方式扩展,但要实现最优训练,需要更多数据:每个参数约需 200 个图像 token,约为语言模型 Chinchilla 计算最优建议的十倍。与语言模型不同,
ASI-Bench是一项用于评估AI系统能否在有限人类指导下开展科学研究并创造新知识的新基准。该基准涵盖11个科学领域的60项项目级研究任务,并逐步减少人类提供的方法指导。在对18种先进代理与模型配置的测试中,系统在获得完整方法指导时的平均得分为50.91;当必须自行选择研究方法时,得分降至26.62。结果表明,当前AI系统仍高度依赖人类指导,距离自主完成端到端的科学研究还有明显差距。ASI-Be
研究人员提出多字节预测方法,以加快字节级层次化语言模型的推理速度。该方法能够并行生成多个字节,无需增加额外参数,同时对模型性能的影响较小。它采用与模型潜在片段对齐的可变长度预测窗口,并设计了新的注意力掩码机制,在支持并行字节预测的同时保持因果性。在文本生成、指令遵循、问答、摘要和机器翻译等任务上的评估显示,该方法在性能与推理吞吐量之间实现了较好的权衡。
论文提出 Agentic ESOpt,使用进化策略(ES)替代传统强化学习,微调需要长期交互的 LLM 智能体。ES 可以在接近推理阶段的 GPU 显存占用下优化模型全部参数,从而避免沉重的反向传播训练流程,以及长轨迹中的奖励归因难题。该方法在当前模型参数附近采样扰动,评估生成智能体的奖励,并执行在线奖励加权更新;同时通过参数与上下文的协同演化提升适应能力。为平衡探索与适应,方法还采用扰动尺度的余
皮尤研究中心的一项调查显示,52%的美国人对人工智能在日常生活中的使用增加感到担忧多于兴奋,高于2021年的37%。在30岁以下人群中,这一比例达到55%,表明年轻人的担忧仍在上升。总体来看,近年来美国公众对人工智能的忧虑持续加深。
欧洲央行警告,当前围绕生成式AI和聊天机器人的投资热潮,可能为市场大幅调整埋下伏笔。欧洲央行5名经济学家和研究人员撰写的文章指出,在投资者和企业期待AI带来前所未有生产力提升的背景下,美国股市估值已接近历史高位。欧洲家庭通过直接或间接方式持有约4400亿欧元的美国科技股,保险公司和养老基金也持有大量相关资产。因此,一旦AI相关股票估值下跌,影响可能从华尔街扩散至欧洲金融市场和实体经济。欧洲央行将当
Anthropic介绍了两项实验,展示Claude如何协助开展蛋白质设计和分析化学工作。该公司表示,结果表明Claude可能帮助生命科学研究人员提高研究速度,但目前信息主要来自Anthropic自身披露。公司还计划推出面向科学家的研究访问计划。
据 Artificial Analysis 称,Z.ai 的 GLM-5.3 在启用最大推理设置后,于 Artificial Analysis Intelligence Index 获得 60 分。该成绩与 Kimi K3 持平,比 GLM-5.2 高 7 分,但低于 Opus 5 的 63 分和 Fable 5 的 62 分。如果按计划发布权重,GLM-5.3 可能跻身领先的开放权重模型之列。这