AI 新闻中心

AI 新闻中心 过去一年分析了 1728 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

AI“教母”李飞飞:经营初创公司让我展现出“虎妈”的一面

斯坦福大学教授、World Labs联合创始人李飞飞表示,经营这家AI初创公司后,自己越来越显露出严格且具有家长色彩的一面。作为公司资历最深的人,她对年轻的工程师、研究人员和科学家提出了较高要求。World Labs正在开发“世界模型”,希望让AI系统理解三维环境并与之互动。今年早些时候,公司宣布获得10亿美元新融资,投资方包括AMD、Autodesk和英伟达。李飞飞同时强调,创始人和高级管理者不

MiniMax 发布 Design,释放 H3 多模态视频模型的内容生产力

MiniMax 发布了多模态创作 Agent 工作台 MiniMax Design,旨在将原生多模态视频模型 H3 应用于商业内容生产。系统能够理解用户目标、拆解任务,并调用相应模型和 Skills,完成素材处理、内容生成、编辑与交付。H3 支持多模态理解、视频生成、视频编辑和参考控制。MiniMax Design 在此基础上增加任务规划、素材组织、分镜设计、生成后剪辑和成片装配能力,将创作流程从

快手二季度营收355亿元,可灵AI收入同比增长超200%

快手公布第二季度营收355亿元,调整后净利润39亿元。AI视频生成服务可灵AI收入超过8.5亿元,同比增长超过200%,全球用户突破1亿,覆盖224个国家和地区。可灵AI 3.0系列新增原生4K视频输出,提升视频生成效率和音画同步能力,并通过MCP与CLI支持AI Agent批量调用。快手表示,超过92%的员工使用自研AI Agent,研发人员的AI代码贡献率达到60%。公司还将AI应用于内容生产

开源 AI 模型 Ornith-1.5 系列发布,宣称达到 Opus 4.8 级性能

DeepReinforce 发布了开源 AI 模型 Ornith-1.5 系列。公司称,该系列在训练过程中引入了自我改进循环,让模型持续生成难度更高的任务。旗舰模型 Ornith-1.5-397B 采用混合专家架构,总参数量为 3970 亿,并宣称在部分测试中超过 Claude Opus 4.8。该系列还包括 35B-A3B 模型、稠密型 9B 模型,以及量化版本 Ornith-1.5-9B-Mo

极佳视界发布通用双足人形机器人 Maker L01

中国物理 AI 初创公司极佳视界发布了通用双足人形机器人 Maker L01。该机器人搭载 31 个关节电机,官方称最高移动速度为 4 米/秒,并展示了奔跑、跳跃、空翻和打乒乓球等动作。机器人重 42 公斤,配备 518Wh 热插拔电池。极佳视界表示,其软硬件全栈系统面向科研和赛事开发开放。公司成立于 2023 年,还开发世界模型平台 GigaWorld 和具身基础模型 GigaBrain。据量子

王兴兴:具身智能最快两三年迎来“ChatGPT时刻”

宇树科技创始人兼CEO、CTO王兴兴表示,具身智能最快可能在两三年内迎来重要产业转折,但在较慢情况下,突破可能需要五年至十年。他认为,产业规模化的标准应是机器人能够在80%的陌生环境中,通过语音或文字指令完成约80%的任务。当前主要技术瓶颈包括AI模型与物理世界的对齐、触觉反馈,以及操作最后几厘米时的精度和泛化能力。宇树展示了“物理AI机器人自进化”技术路线,计划结合研究成果检索、控制代码生成、仿

Co-RL:多智能体强化学习中的多样化模型群体涌现无监督推理

该研究提出 Co-RL,一种协作式强化学习框架,由多个相互独立的模型根据彼此的输出生成奖励信号。模型不共享参数,因此可以减少对成本高昂的真实标签的依赖。研究人员表示,增加模型系列、模型规模以及改写训练样本的多样性,有助于降低相关错误和自我强化反馈循环,从而缓解训练崩溃。在七项纯文本基准测试和四项多模态基准测试中,Co-RL 使语言模型平均提升 3.0% 至 8.6%,使视觉语言模型提升 2.3%

训练具备化学合理性感知能力的大语言模型,用于单步逆合成

一项研究提出将 Top-K 提示作为单步逆合成的训练和推理方法,使系统能够生成多条合理的反应路径,而不是只给出一个答案。研究人员构建了 CREED-CCV-2+USPTO-XL 数据集,其中包含约 4,560 万条经过验证的反应,并据此训练化学语言模型 C3LM。模型将微调与基于 ChemCensor 的奖励及面向新颖性的奖励相结合。研究作者称,该模型在分布外基准 URSA-expert-2026

潜在世界模型中的决策指标对齐:用于MPC规划的诊断与动作条件目标

该研究分析了在采用JEPA风格潜在世界模型的模型预测控制中,目标潜在表示的欧氏距离能否可靠反映实际任务进展。作者提出Plan-Real Spearman和CEM-Stage Spearman,用于衡量候选动作序列的潜在排序与真实排序在搜索前及交叉熵方法搜索逐渐集中时的一致性。研究指出,编码器失真、终端滚动预测误差和候选方案之间的差距是影响对齐效果的关键因素。DA-LeWM在LeWM基础上加入逆向动

Zetta ζ:面向自我进化物理智能的高效闭环系统

Zetta是一套面向具身AI代理的闭环控制与学习系统。在冻结基础策略模型的同时,它能够在线演化运行时批评器和恢复技能。三个具有不同时间尺度的循环分别负责在动作频率上进行执行控制、在每次 rollout 层面提出批评与恢复方案,并在通过验证后更新技能。结合将代理逻辑与异构执行资源解耦的Z-Infra,研究团队报告称,Zetta在LIBERO-Pro和RoboCasa上的成功率分别达到90.8%和93

宇树科技创始人:具身智能的关键拐点在于大模型与真机对齐

宇树科技创始人王兴兴表示,人形机器人要实现大规模普及,当前最大的障碍已不再主要是运动硬件,而是大模型与真实机器人之间的对齐。她将具身智能的“ChatGPT时刻”定义为:机器人身处80%的陌生场景时,仅凭语音或文字指令,就能独立完成约80%的任务。王兴兴预计,这一拐点最快可能在2到3年内到来,较慢则需要5到10年。相关判断属于行业预测,目前并不构成技术突破已经实现的证据。

SemComp-Bench:视频生成中的语义任务完成度基准

SemComp-Bench提出了一项面向结果的视频生成评测基准。只有同时实现预期结果,并保持与参考图像相关的任务语义对应,生成结果才算成功。其数据集SemComp-Data覆盖六个领域,包含参考图像、详细和简短指令,以及以结果为中心的视频片段。一个四阶段数据整理流程将原始视频转换为标准化样本。评测使用视觉语言模型回答结构化二元问题,并分别报告结果达成度和生成可靠性分数。对多种代表性视频生成模型的实

Meta 曝光 Muse Video 生成视频样片:单次 AI 最长生成 10 秒

Meta 据报道正在准备推出视频生成模型 Muse Video,目前已邀请部分合作伙伴参与 Beta 测试。公开样片显示,该模型单次最多可生成 10 秒视频,在细节呈现、场景与物体关系理解以及时间连续性方面展现出一定潜力。不过,Meta 承认模型仍存在音画同步不足,以及高速运动物理准确性不够等问题。现有短片样本尚不足以证明其在长时长叙事、角色持续一致性或复杂动作场景中的稳定表现。

FM-Bench:评估竞争代理长期管理能力的基准测试

FM-Bench评估语言模型代理能否在行动后果不断累积的长期环境中持续做出有效决策。每个代理使用26种工具和约340至400个决策节点,管理一支足球俱乐部20个游戏内赛季。它需要组建阵容、交易球员、谈判合同、投资设施和青训、安排首发,并向有权解雇它的董事会负责。最终分数由确定性引擎计算,不使用LLM裁判或人工评分。在针对15个前沿模型的单人赛和共享世界Arena测试中,所有模型都完成了整个周期。C