AI 新闻中心

AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

GS-Voxel:用于大规模 3DGS 生成的免拟合结构化潜变量

GS-Voxel 是一个用于大规模 3D Gaussian Splatting(3DGS)场景生成的结构化潜变量框架。它能将无序、空间不规则且经过预优化的 3DGS 重建确定性地转换为稀疏活动体素,无需针对每个场景进行额外优化,同时保留所选图元的位置和渲染属性。分解式 VAE 分别编码体素几何结构与局部高斯属性。随后,图像条件流模型根据卫星视角图像生成航空 3DGS 场景。通过考虑重叠区域的分块推

从语料库到协同演化能力:面向通用图像生成的能力中心化数据设计

该研究提出了一套以能力为导向的数据基础设施,用于训练通用图像生成模型。系统将文本—图像对齐、图像变换和图像—知识关联等专门监督数据结合起来,并按照能力之间的依赖关系,逐步调整任务组合、视觉概念分布、数据质量和图像分辨率。该基础设施包含4.4亿张文生图图像、1.2亿组编辑数据对,以及超过2,700万组图像—实体数据对。研究人员基于这些数据从头训练了30亿和60亿参数的扩散模型,并通过CPI-Benc

A.I.G. 评估 DeepSeek Harness 抵御间接提示注入的能力

一项研究使用 AI-Infra-Guard 评估 DeepSeek Harness(DSH)抵御间接提示注入攻击的能力。研究覆盖 16 个间接内容渠道、文本和文件载体、35 个攻击目标及 12 种攻击方法,共进行了 14,560 次受控执行。研究保留了 DSH 的智能体循环、工具注册、模型适配器和会话事件路径,并通过本地测试工具避免外部副作用。观察到的最高攻击成功率分别为:文本模式下的虚假完成攻击

从序列到结构:面向大语言模型智能体的关系不确定性传播

研究人员提出 RUPA,用于量化大语言模型智能体在完整执行轨迹中的不确定性。该方法不再仅依赖词元概率、预测熵或单步置信度等局部信号,而是将推理状态、工具交互和环境反馈之间的依赖关系表示为有向轨迹图,并在图中传播不确定性,以捕捉执行风险的累积和转移,从而更早发现失败。研究团队使用 6 个开源大语言模型,在 τ-2、Terminal-Bench-2 和 GAIA 基准上进行评估。结果显示,RUPA 的

aDSL:通过代理与程序协同设计实现代理式三维创作

该论文提出了 aDSL,一种面向程序化三维创作的代理中心型领域专用语言,并配套开发了按角色分工的多代理系统。代理不再依赖容易出错的绝对坐标,而是使用表达空间关系的关系运算符来操作几何结构。无需额外训练的“规划—执行—批评”流程会拆解用户请求、生成代码,并根据执行反馈修复错误和约束违规。实验表明,与既有基于大语言模型的方法相比,该方法在文本生成形状和图像生成形状任务中提升了鲁棒性、可控性以及对用户意

StartupBench:基于市场验证的端到端工作流评测通用智能体

StartupBench是一项评估AI智能体执行完整真实工作流程能力的基准测试。它不主要依赖研究人员挑选的任务,而是以已证明拥有用户采用率和实际需求的AI产品为基础,覆盖多个专业领域。研究人员将这些工作流转化为面向交付成果的任务,并通过细致的评分标准进行评估。即使是测试中表现最强的模型,也只能完整完成约30%的任务,尽管在许多任务上取得了明显的部分进展。复杂指令遵循和领域专业知识不足是主要失败原因

Abra:扩展图像扩散模型训练规模

一项系统性研究利用 Abra(一系列受控的流匹配 Transformer),分析文本生成图像扩散模型的扩展规律。研究使用 10^19 至 10^22 FLOPs 的计算量训练模型,覆盖三个数量级。结果显示,扩散模型与语言模型一样,能够以可预测的方式扩展,但要实现最优训练,需要更多数据:每个参数约需 200 个图像 token,约为语言模型 Chinchilla 计算最优建议的十倍。与语言模型不同,

ASI-Bench:人工超级智能的黎明

ASI-Bench是一项用于评估AI系统能否在有限人类指导下开展科学研究并创造新知识的新基准。该基准涵盖11个科学领域的60项项目级研究任务,并逐步减少人类提供的方法指导。在对18种先进代理与模型配置的测试中,系统在获得完整方法指导时的平均得分为50.91;当必须自行选择研究方法时,得分降至26.62。结果表明,当前AI系统仍高度依赖人类指导,距离自主完成端到端的科学研究还有明显差距。ASI-Be

层次化语言模型的动态多字节预测

研究人员提出多字节预测方法,以加快字节级层次化语言模型的推理速度。该方法能够并行生成多个字节,无需增加额外参数,同时对模型性能的影响较小。它采用与模型潜在片段对齐的可变长度预测窗口,并设计了新的注意力掩码机制,在支持并行字节预测的同时保持因果性。在文本生成、指令遵循、问答、摘要和机器翻译等任务上的评估显示,该方法在性能与推理吞吐量之间实现了较好的权衡。

Agentic ESOpt:以最低 GPU 需求微调长程 LLM 智能体

论文提出 Agentic ESOpt,使用进化策略(ES)替代传统强化学习,微调需要长期交互的 LLM 智能体。ES 可以在接近推理阶段的 GPU 显存占用下优化模型全部参数,从而避免沉重的反向传播训练流程,以及长轨迹中的奖励归因难题。该方法在当前模型参数附近采样扰动,评估生成智能体的奖励,并执行在线奖励加权更新;同时通过参数与上下文的协同演化提升适应能力。为平衡探索与适应,方法还采用扰动尺度的余

欧洲央行警告AI投资过热:泡沫破裂或冲击全球经济

欧洲央行警告,当前围绕生成式AI和聊天机器人的投资热潮,可能为市场大幅调整埋下伏笔。欧洲央行5名经济学家和研究人员撰写的文章指出,在投资者和企业期待AI带来前所未有生产力提升的背景下,美国股市估值已接近历史高位。欧洲家庭通过直接或间接方式持有约4400亿欧元的美国科技股,保险公司和养老基金也持有大量相关资产。因此,一旦AI相关股票估值下跌,影响可能从华尔街扩散至欧洲金融市场和实体经济。欧洲央行将当