AI 新闻中心

AI 新闻中心 过去一年分析了 8086 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Vidu S2:实时交互、可编辑与空间视频生成

Vidu S2由Vidu S2-Avatar和Vidu S2-Editing组成,前者是实时交互式数字角色模型,后者是实时视频编辑模型。研究团队还探索了两者进行实时空间视频生成的可行性。与Vidu S1相比,S2-Avatar支持实时生成720p视频,能够使用可随时更新的动态参考内容,并更好地遵循跳舞等指令。S2-Editing可以实时编辑视频流,包括风格渲染以及服装、角色和背景替换。根据公布的实

并非所有提示词都相同:面向多模态强化学习后训练的探索引导式提示词支架

一项研究提出了一种方法,在多模态大语言模型的强化学习后训练过程中动态调整训练提示词的分布。探索潜力评分(EPS)利用在线策略回滚统计数据,估计提示词能够提供的学习价值。该方法不直接丢弃低价值提示词,而是让教师模型在保留原始任务意图的前提下进行改写,从而产生更有信息量的训练信号。与GRPO结合后,该方法在Geo3K和MMK12上均超过基线,域内相对提升最高达9.7%,在MathVision和MMMU

PhysBrain 1.5:从视觉语言模型迈向物理基础模型

PhysBrain 1.5 是一个用于理解物理环境、生成动作和预测未来状态的统一模型。它将语言响应、末端执行器运动和视觉目标编码为离散序列,并通过自回归下一词预测进行联合训练。预训练完全采用人类交互视频,随后使用人类示范、机器人轨迹和模拟经验进行监督微调。作者称,这个拥有80亿参数的开源模型在28项具身理解基准测试中平均得分72.5,并在其中14项取得开源模型最佳成绩。这些性能数据属于作者报告,仍

消息称英国国王查尔斯三世本周将与科技巨头高管讨论人工智能

据报道,英国国王查尔斯三世计划本周在苏格兰邓弗里斯主持一场峰会,邀请多家大型科技公司的高管讨论人工智能。受邀者据称包括英伟达首席执行官黄仁勋、谷歌DeepMind董事长德米斯·哈萨比斯和OpenAI首席财务官莎拉·弗里亚,以及Anthropic、IonQ、英国政府和梵蒂冈的代表。会议将讨论如何让人工智能发展造福社会,以及制定共同准则是否有助于推动负责任的创新。目前尚未确认任何具体法规、协议或技术发

AI大模型助力水稻种植:四川300亩试点田最高亩产863.6公斤

四川省眉山市永丰村一处300亩水稻试点田首次采用水稻专用AI大模型进行田间管理。无人机负责采集农田数据,系统在插秧、水肥调控和病虫害预警等环节提供建议。专家按照规范测产,三个核心品种的亩产达到826.8至863.6公斤。试点田亩产较2023年提高152.6公斤。研究人员表示,良种、栽培技术与AI精准管理相结合,可能形成可向其他地区推广的增产技术路径。

LLaDA-UI 将分块扩散引入视觉语言 GUI 智能体

LLaDA-UI 是一个拥有 167 亿参数的 GUI 智能体,将混合专家架构与分块扩散生成相结合。该系统先进行多模态预训练,随后使用移动端、桌面端、网页界面和视觉定位数据进行有监督微调。在多项定位与导航基准测试中,LLaDA-UI 的表现超过 Qwen2.5-VL-7B,并在报告的六项 GUI 基准中的四项超过 Qwen3-VL-8B。研究结果表明,分块扩散可以成为多模态 GUI 智能体的一种实

Attention-DP3:通过几何对齐注意力实现物体感知的三维扩散策略

Attention-DP3是一种三维扩散策略,旨在帮助机器人在物体遮挡、混杂且干扰物较多的操作场景中识别与任务相关的几何信息。该方法首先对RGB图像进行开放词汇二维分割,再利用经过标定的相机几何将目标物体掩码提升到三维空间。其三场注意力条件机制分别强调目标物体、目标内部与任务相关的区域,并抑制背景和干扰物。 在Adroit、DexArt、MetaWorld以及真实SO101平台上的实验显示,该方法

BVB:通过 Blender 程序化重建评测智能体视频理解能力

BVB,即 Blender-VideoBench,用于评估多模态智能体能否通过编程,将现实世界视频重建为带动画的 Blender 场景。所有智能体都在相同的沙盒环境中完成重建,评测指标包括保留视频时空事实的能力,以及与原始视频的感知相似度。在来自 10 个模型系列的 51 种配置中,最佳模型的潜在相似度达到 88.6,但仅保留了原视频正确时空答案的 53.7%。增加推理过程可以提升视觉相似度,却无

Discovery Foundation Models:迈向开放式发现智能

该研究提出“发现基础模型”,这类 AI 系统不仅能够利用现有知识进行推理或解决人类定义的任务,还能参与提出新问题、构建新表示、形成假设并创造知识。其框架 Zetema 维护可修订的研究状态,验证证据、控制实验,并跨任务持续改进发现能力。GALILEO 将干实验室推理、机器人和实际湿实验室实验、外部生物学证据以及反复的假设修订结合起来,应用于治疗研究。研究还提出了超越最终答案准确率、训练和评估发现过

Dream-RSI:通过不断演化的世界实现递归式自我改进

Dream-RSI 是一个用于可扩展、递归式改进自主 AI 智能体探索策略的框架。它将历史发现树构建为回放模拟器,使策略能够通过即时、低成本的离策略反馈进行评估和优化,而无需反复执行昂贵的在线评估。改进后的策略会重新部署,以推动后续发现,形成持续自我改进的循环。在算法工程、数学优化和 GPU 内核工程测试中,Dream-RSI 在多个场景下取得了具有竞争力或更高的发现质量,同时显著降低了发现成本。

中国新五年规划将提升先进制程能力并强化人工智能硬件

中国工业和信息化部、国家发展改革委发布“十五五”电子信息制造业发展规划。规划提出提升先进制程制造能力,突破高端手机核心芯片和高性能PC芯片,并夯实人工智能芯片与终端的硬件基础。同时,相关部门将加强开源鸿蒙等国产操作系统搭载,推进RISC-V研发与产业化,构建人工智能软硬件全栈生态。规划还覆盖先进封装、电子设计自动化工具、智能终端和消费电子等领域,并提出到2030年规模以上企业营业收入突破30万亿元

谷歌向全体工程师开放 Anthropic Claude

据 Business Insider 报道,谷歌已通过内部开发平台 Antigravity,向全公司工程师开放 Anthropic Claude 的使用权限。员工可在个人配额内使用包括 Claude Opus 5 在内的部分第三方模型。谷歌表示,Gemini 仍是内部开发的主要模型,Claude 则作为专门用例的补充工具。此前,Claude 主要仅限 DeepMind 团队及部分高优先级项目使用。

Omni-Streaming Thinking 旨在减少多模态模型的过早判断

Omni-Streaming Thinking(OST)是一种让模型持续处理视频和同步音频的方法。它将视觉与听觉证据分开保存,先把结论标记为待验证,并在未来证据出现时进行检查。检测到矛盾后,系统会降低相关结论及其依赖状态的影响,再依据新证据更新模型状态。研究人员使用轻量适配的 Qwen3-Omni-30B-A3B-Instruct 进行测试,报告称 OST 在五项流式和视听基准测试中平均超过开放基