AI 新闻中心

AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

VGI-Bench:探究视频生成模型的视觉智能

VGI-Bench 是一个用于评估视频生成模型视觉推理能力的基准测试,包含 27 项任务和 810 个实例,并按任务领域和技能标签进行分类。评估结果显示,当前生成系统能够解决部分基于视觉的推理任务,但整体可靠性仍然不足。即使是表现最强的模型 Seedance 2.0,按照该研究的评估标准也只达到 51.0%。研究还分析了输出失败模式、对输入条件的敏感性、合成数据微调带来的性能迁移边界,以及去噪过程

Prefix Sliding 提升测试时扩展效率

Prefix Sliding 研究提出了一种降低语言模型长时间推理内存成本的方法。模型不再通过完整注意力机制保留全部推理轨迹,而是仅保留包含关键指令和工具信息的前缀,以及最近几千个词元组成的窗口。这样,无论推理持续多久,内存需求都能保持在固定上限内。研究人员称,在无需额外训练的情况下,该方法可让现有模型提速最多三倍,同时保持性能。结合强化学习后,模型还能处理超过十万个词元的推理轨迹,并取得更好表现

黄仁勋再次称英伟达已实现AGI——但这并没有多大意义

在英伟达的财报电话会上,首席执行官黄仁勋表示,公司已经实现了人工通用智能(AGI),这是科技行业多年来追逐的终极目标之一。但几乎就在随后,他又称这一里程碑“毫无意义”。由于业界尚未对AGI形成广泛认可的定义或客观测试标准,这一说法并不能证明英伟达确实在技术上实现了AGI。

Adobe 开始测试 Photoshop“AI 辅助编辑器”:通过提示词编辑图像

Adobe 发布了 Photoshop“AI 辅助编辑器”测试版。该可选模式提供简化界面,用户可以通过自然语言提示词编辑图像。功能包括“提示词编辑”、移除背景、生成式扩展、生成式填充和图像放大。“AI 标记”允许用户在图像上大致选择或绘制区域,再用文字描述需要进行的修改。生成结果会创建为新图层,用户可以继续在辅助编辑器中调整,也可以返回传统 Photoshop 专业编辑模式。Adobe 还加入了基

能力问题:大语言模型的技能是否与语言无关?

一项研究考察大语言模型在不同语言中是否具备相同能力,并将语言影响与知识水平及通用基准测试表现区分开来。在多语言自我对弈实验中,同一模型的两个实例分别使用不同语言,在六种文本游戏中对战。模型、规则、状态空间和可用行动均保持不变。研究人员在八种语言上评估了三个开放权重模型,发现模型的对战能力、无效行动数量和策略倾向会因语言不同而显著变化。空间推理、基于卡牌的决策以及最优行动选择中都出现了特定语言的失误

高通:基于我们的 SoC 平台可以构建 L3 级解决方案

高通 ADAS 和机器人业务总经理 Anshuman Saxena 表示,Snapdragon Ride SoC 平台可以用于构建 L3 级自动驾驶解决方案。高通的 L2+ 系统目前已经量产。Saxena 认为,L3 初期将主要部署在高速公路等结构化程度较高的场景,中国在 L3 和 L4 的落地速度可能快于其他市场。平台最终用于哪个自动驾驶级别,将由汽车厂商决定。高通目前正与宝马、零跑汽车以及中国

Day-0 支持:摩尔线程宣布快速完成智谱 GLM-5.3-Flash 适配

智谱近日开源 GLM-5.3-Flash,模型总参数量为 3200 亿,激活参数为 180 亿。摩尔线程表示,已基于 MTT S5000 AI 训推一体加速卡和 MUSA 软件栈,在模型发布当日完成支持。公司针对模型线性注意力架构中的 KDA 机制优化了相关算子,并与 SGLang-MUSA 缓存管理系统完成整合。智谱称,该模型在 Artificial Analysis Intelligence

DLSS-NR DLL 首次现身《NBA 2K27》游戏文件,体积暴增暗示重大升级

《NBA 2K27》抢先体验版的游戏文件中发现了一款此前未公开的 NVIDIA DLL,文件名为 nvngx_dlssnr.dll。系统将其识别为 NVIDIA DLSSNR,版本号为 310.8.0.0,体积达到 158MB,远高于当前 DLSS 库通常 20 至 50MB 的大小。文件名中的“NR”与 NVIDIA 已宣布的神经渲染技术 DLSS-NR 相符。这可能是首个在已发布游戏中公开发现

SWE Refactor Bench:编程智能体能否完成长期的全代码库迁移?

SWE Refactor Bench评估编程智能体是否能真正执行整个软件代码库的技术迁移,而不仅是让现有测试通过。该基准包含20项迁移任务,覆盖四类技术债务,并检查迁移完成度、行为正确性以及隐藏的行为差异。在8个前沿模型的520次运行中,只有28次通过全部三个阶段,13项任务没有获得可接受的解决方案。表现最佳的Claude Opus 5得分为47.0分。结果显示,智能体经常跳过迁移,或在尝试迁移时