AI 新闻中心

AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

PixRestore:基于像素扩散 Transformer 的统一图像修复

PixRestore 是一种不依赖 VAE 的 Diffusion Transformer,可直接在像素空间中修复受损图像。不同于依赖预训练文生图模型的方法,该模型完全从头训练。它在经过分块处理的像素上执行流匹配,以保留细节,并根据不同的图像退化类型调整特征条件。研究人员还使用基于 DINO 的训练目标,将模型微调为单步推理版本,以提高效率。论文称,约 5000 万参数的模型在公开基准和真实世界测

腾讯大规模人事重组:姚顺雨掌舵基础模型

腾讯混元多模态团队近期展开人事与战略重组。前xAI多模态理解负责人蔺旭东加入腾讯,担任多模态内容生成算法负责人;原负责人胡瀚离职创业,前OpenAI研究员田永龙也加入腾讯。腾讯已将大语言模型部门与多模态模型部门合并为基础模型部,由姚顺雨全面负责。新的技术方向是将多模态理解能力更深地融入基础模型,提升上下文处理、推理和工具调用的稳定性,并推动其在办公软件和GUI智能体中的应用。这一调整表明,腾讯正更

MoE-ViE:用于高效图像和视频理解的混合专家视觉编码器

该研究探讨了用于扩展 CLIP 类视觉编码器的混合专家架构。研究人员发现,细粒度专家拓扑结构的表现优于密集模型和标准 MoE 架构。论文还提出了一种无需辅助损失的专家均衡方法,以及用于降低推理延迟开销的专用 MoE 内核。为提升视频能力并保留图像知识,研究采用了帧级蒸馏和一种新的冻结机制。研究团队预训练了多个规模的 MoE-ViE 模型,均稳定超过对应的密集模型。最大模型以相当于其 76% 的延迟

乔治·霍茨创办的公司推出 Chestnut eGPU 扩展坞,车载 AI 浮点运算能力提升约 100 倍

乔治·霍茨创办的自动驾驶技术公司 comma.ai 推出外置 eGPU 扩展坞 Chestnut,售价 249 美元;搭载 8GB AMD Radeon RX 9060 的完整套件售价 799 美元。公司称,Comma Four 搭配 Chestnut 后,算力接近特斯拉 HW4。车载计算机的功耗上限将从约 10W 提高到约 100W,从而支持运行更大的 openpilot AI 模型。comma

Agent Lightning v1.0 推进代理强化学习研究

Agent Lightning v1.0 是一个轻量级开源框架,用于“代理运行框架驱动的强化学习”。在这种架构中,部署时使用的代理框架会直接参与模型后训练。该框架支持任意代理框架,并处理重新分词、优势计算、损失归一化和后端调度等挑战。在指令遵循、搜索和编程代理评测中,仅使用 6,000 个训练样本和适度算力,就将 Qwen3.5-9B 在 SWE-bench Verified 上的成绩从 41.8

Modular宣布Mojo编程语言以Apache 2.0许可证全面开源

Modular已将编程语言Mojo、其编译器及核心工具链全面开源,采用带有LLVM例外条款的Apache 2.0许可证。Mojo旨在解决传统语言在现代硬件,尤其是GPU和AI加速器上的性能限制。随着Mojo 1.0源码稳定版完成,编译器源码现已上线官方GitHub仓库。开发者可以使用Bazel构建编译器并运行测试,也可以使用预构建的nightly二进制版本,以节省编译时间。Mojo标准库自2024

阿里巴巴5纳米RISC-V芯片据称无需独立GPU即可运行270亿参数模型

阿里巴巴表示,64位服务器处理器玄铁C950能够在不使用模拟层或独立显卡的情况下,原生运行通义千问3.8-27B模型。该芯片采用5纳米工艺,配备64个计算核心,并集成面向AI推理的矩阵和向量加速引擎。据报道,运行该模型时,其生成速度约为每秒30个Token,首Token延迟低于1.9秒。阿里巴巴还宣称其单核性能达到RISC-V处理器中的纪录水平。上述数据来自所提供的报道,仍需通过独立基准测试和可复

aDSL:通过代理与程序协同设计实现代理式三维创作

该论文提出了 aDSL,一种面向程序化三维创作的代理中心型领域专用语言,并配套开发了按角色分工的多代理系统。代理不再依赖容易出错的绝对坐标,而是使用表达空间关系的关系运算符来操作几何结构。无需额外训练的“规划—执行—批评”流程会拆解用户请求、生成代码,并根据执行反馈修复错误和约束违规。实验表明,与既有基于大语言模型的方法相比,该方法在文本生成形状和图像生成形状任务中提升了鲁棒性、可控性以及对用户意

智谱上线 GLM-5.3 API,模型权重将于下周五开源

智谱已正式上线 GLM-5.3 API。公司称,该模型擅长复杂编码、防御性网络安全和长程任务,并在 Artificial Analysis Intelligence Index 中获得 60 分,进入前沿模型能力区间,位列开源模型前列。不过,这些性能对比主要依据智谱公布的评测结果。API 定价与 GLM-5.2 保持不变。智谱表示,性能提升主要来自后训练,基础模型与上一代相同。GLM-5.3 已接

Anthropic推出文本水印后,去水印工具开始涌现

Anthropic开始为部分Claude模型生成的文本添加人类难以察觉的统计水印。由于水印嵌入模型的选词模式,即使用户复制粘贴文本,标记也可能保留下来;即便只是用AI进行校对、翻译或总结,最终内容也可能带有水印。开发者随后陆续推出去水印工具,包括开源项目Watermarks Remover。该工具会删除隐藏字符和元数据,再重新改写文本,以破坏可能携带水印的统计模式。不过,这些项目仍处于早期阶段,实

StateM通过执行框架扩展,在Terminal-Bench 2.1上达到95.3%准确率

StateM是一套面向AI代理的运行时系统,通过持久状态、阶段化上下文、经过检查的状态转换、可恢复运行手册和版本化程序规则,改进长时任务执行,同时不修改模型权重。研究团队称,在Terminal-Bench 2.1上,StateM使GPT-5.6 Sol xhigh在445次试验中达到95.3%的原始准确率,并让89项任务全部至少成功一次。GPT-5.5、GPT-5.6 Luna和DeepSeek-