Hydra-0:用于通用世界建模与控制的动作流
Hydra-0是一种通用世界模型,将机器人动作表示为像素运动。该共享视觉接口能够在不同机器人形态、任务、环境和视频生成骨干之间学习动作后果。最佳配置相比动作条件基线,将机器人运动误差降低了90.4%,物体运动误差降低了60.2%。在RoboLab基准测试中,Hydra-0的重放成功率与参考成功率之间达到0.96的皮尔逊相关系数。研究还发现了该接口的逆向模式:根据从人类示范中迁移得到的目标物体运动,
AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Hydra-0是一种通用世界模型,将机器人动作表示为像素运动。该共享视觉接口能够在不同机器人形态、任务、环境和视频生成骨干之间学习动作后果。最佳配置相比动作条件基线,将机器人运动误差降低了90.4%,物体运动误差降低了60.2%。在RoboLab基准测试中,Hydra-0的重放成功率与参考成功率之间达到0.96的皮尔逊相关系数。研究还发现了该接口的逆向模式:根据从人类示范中迁移得到的目标物体运动,
卡迪夫大学和墨尔本大学的一项研究发现,生成式人工智能目前还无法像人类教师一样可靠地评估学生的书面作业。研究人员使用两个版本的 ChatGPT,按照 7 项标准和 4 种提示方式,为 50 篇生物科学专业本科生论文评分。虽然 AI 与人工评分的总体平均分较为接近,但在具体评分标准和单篇论文上存在明显差异。平均分的最大差距为 16.1 分,单篇论文的差距则达到 40 分。AI 还倾向于压低高分论文的成
汤森路透公布了首款大型语言模型“Thomson”,该模型基于阿里巴巴的Qwen3.5-397B。公司表示,整体研发成本约为4000万美元;此前广泛传播的45万美元,仅指最后一次训练的成本。汤森路透与帝国理工学院合作,重新训练基础模型,使其符合安全、伦理和政治中立要求,随后使用自有内容进行预训练、后训练,并在内部环境中开展强化学习。公司称,Thomson已跻身全球顶尖AI模型之列。在Stanford
SparsePR是一种无需额外训练即可加速视频Transformer和世界模型注意力计算的方法。它将响应耦合分区与探针拟合的残差重建相结合,通过少量精确计算的查询行校正稀疏输出。在四个不同的视频生成和世界模型上测试时,SparsePR均降低了注意力重建误差。在实际执行配对密度为22.0%至26.0%的情况下,该方法保持了生成质量,并实现了1.48至2.61倍的端到端加速。
FlavourBench是一项自动化语言模型基准测试,利用经过版本控制的烹饪系统提供可复现的真值。每项任务给出8种食材,要求模型选择3种组成组合;在运行模型前,系统会先评估全部56种可能组合。研究使用涵盖替代、搭配和受限组合的534项任务,评测了27个前沿模型端点。Grok 4.6的点估计最高,为65.1分;351组模型配对中有101组得出了统计上明确的结论。发布内容包括提示词、原始回答、完整评分
七家领先建筑事务所介绍了它们如何为人工智能时代开发自有工具。建筑业是人工智能最难攻克的领域之一,因为可用于训练建筑模型的数据并未广泛公开在网上。数字图纸、三维模型以及手绘草图通常存储在各家事务所的服务器或实体档案柜中,其复杂程度远高于当前 AI 工具已经能够快速掌握的简历写作或 HTML 编码。
本文综述基础模型时代的以人为本智能研究,提出一个由六个相互关联层次构成的人类情境分类体系,涵盖人的外观与空间几何、运动动力学与交互建模,以及世界模拟和具身智能体。文章还系统整理了相关数据类型、计算架构、训练与推理优化策略、数据集、基准测试和评估指标,并梳理分散于不同任务、模态和研究社区中的代表性方法。研究进一步讨论如何构建可扩展、可信赖、具有物理基础并能够实际部署的以人为本人工智能,同时提供持续更
为期5天的2026世界机器人大会于8月23日在北京闭幕。大会举行了7场主论坛和71场同期活动,吸引1000余位专家参加,发布44项新技术和新方案,并公布了涉及人形机器人、具身智能和应急应用的倡议与报告。373家企业集中展示了3000余件产品,其中311件为首次发布。30家国际机构和40家境外企业参与了大会。会议还宣布成立世界模型专家委员会。主办方称,中国今年上半年人形机器人出货量超过4万台,占全球
三星正研究让 HBM 超越高速内存的传统角色。由于 HBM 基底芯片采用先进逻辑工艺制造,三星认为它未来可能承担部分 SoC 功能。公司提出将内存控制器从处理器转移到 HBM 基底芯片,这或许能释放处理器约 5% 至 10% 的面积,用于增加计算晶体管。此外,三星还在研究 aHBM,尝试将内存与有限的计算能力结合,以处理部分 AI 工作负载。这些方案目前仍处于研发阶段,尚未成为成熟的商用产品。
Daedalus-150M 并不是先训练大型模型再压缩到 CPU,而是从一开始就针对普通 CPU 推理进行设计。18 个模块中只有 6 个使用完整注意力,其余 12 个采用记忆范围固定为两个时间步的短卷积,从而减少对不断增长的缓存的重复读取。该模型使用 599 亿个 token 从头训练,在五项任务基准测试中获得 47.31 分,高于训练前预先设定的 42.20 基准。与使用相同数据训练、规模相同
文章分析了2026年人工智能产业的发展趋势,认为行业竞争正从单一模型转向整合模型、Agent、算力、数据、工程和组织能力的系统竞争。文章称,WAIC 2026上,以AI Agent和智能应用为主要标签的参展主体多于基础大模型企业。其核心观点是,Agent的能力上限最终取决于基础模型在预训练阶段形成的推理能力和世界知识,编排框架只能组织流程,无法从根本上弥补模型能力不足。文章还讨论了软件开发从Cop
阿里巴巴达摩院与盛京医院等机构推出 DAMO LiON,通过增强 CT 影像识别微小肝癌病灶和肝转移。在为期两个月的真实世界前瞻性研究中,该模型发现了 15 例初次阅片时被遗漏的恶性肿瘤,其中大多数病灶约 1 厘米。研究人员称,AI 辅助使阅片时间缩短 27%,敏感性提高 11.5%。如果 AI 判断与初诊结论不一致,病例将由资深医生复核,必要时进行多学科讨论。相关研究已发表于《自然·医学》。
EviRank 将多模态图像重排序建模为语义约束满足问题。系统会把纯文本、纯图像或组合查询解析为结构化证据包,其中包含实体、属性和关系等条件,并将其标记为必需、禁止或可忽略。该免训练方法结合确定性的规则评分与基于证据的列表比较,对候选图像进行验证。在涵盖文本到图像、图像到图像及组合检索的五个基准测试中,作者报告了业界领先的性能。通过知识蒸馏得到的轻量学生模型在显著降低成本的同时,保留了教师模型超过
一项新研究提出了一种两阶段方法,用于高效估计大规模混合专家(MoE)模型的最佳学习率。该方法首先将小型代理模型的结果迁移到不同模型宽度,随后利用缩放定律外推到超大规模的 Token 预算。在预测最高达 10 万亿 Token 的训练任务学习率时,线性回归取得了 0.95 的 R²。研究人员针对采用多头潜在注意力和 Muon 优化器的 MoE 架构,调整了最大更新参数化方法。该方法还被用于从零开始预
阿里巴巴达摩院联合中国医科大学附属盛京医院等机构研发DAMO LiON模型,可通过CT影像识别微小肝脏恶性病灶。在为期两个月的前瞻性真实世界临床试验中,该模型分析了1万多名患者的影像,发现15例初次诊断时被遗漏的恶性肿瘤,其中大多数病灶直径约1厘米。医生使用AI辅助阅片后,判读时间减少27%,对恶性肿瘤的敏感性提高11.5%。该模型尤其有助于发现容易被忽视的肝转移,并推动部分患者调整治疗方案。研究