Meta计划数周内推出AI智能体Hatch,Watermelon模型预计10月亮相
据《The Information》援引内部文件报道,Meta计划在未来数周推出面向消费者的AI智能体平台Hatch,并于10月发布代号为Watermelon的新AI模型。Hatch旨在从传统对话式AI转向自主执行任务的智能助手,可访问DoorDash、Etsy、Reddit、Yelp和Outlook等服务。平台可能提供可定制面板,方便用户管理智能体创建的工具和技能。Meta正在考虑分级订阅方案,
AI 新闻中心 过去一年分析了 1731 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
据《The Information》援引内部文件报道,Meta计划在未来数周推出面向消费者的AI智能体平台Hatch,并于10月发布代号为Watermelon的新AI模型。Hatch旨在从传统对话式AI转向自主执行任务的智能助手,可访问DoorDash、Etsy、Reddit、Yelp和Outlook等服务。平台可能提供可定制面板,方便用户管理智能体创建的工具和技能。Meta正在考虑分级订阅方案,
RIBOSPAN 是一个拥有 16.1 亿参数的双向 RNA 基础模型,原生以最长 10,240 个核苷酸的上下文进行预训练。该模型结合单核苷酸标记化、密集双向注意力和注意力隔离的序列打包机制,用于以高分辨率建模完整长链 RNA。评估显示,RIBOSPAN 在核苷酸重建和上下文表征方面表现出色,在多种 RNA 类型上取得整体领先结果,并在长 RNA 上保持明显优势。基于同一模型骨干,研究人员还开发
该研究评估生成式世界模型能否取代物理引擎、游戏引擎和强化学习环境等传统模拟器。研究团队以资产构建、物理、交互、可控性、稳定性、状态反馈、多样性和评估指标八项能力为标准,分析了2018年至2026年6月发表的200项代表性工作。世界模型已在特定场景中实现交互和控制的功能性替代,但在物理定律的形式化保证、结构化状态反馈以及可复现的长期演化方面仍落后于传统模拟器。状态反馈是各技术路线共同且最被忽视的短板
EchoWM 是面向交互式生成媒体的全模态世界模型。它能够响应连续导航,同时生成 720p 视频、环境音、音乐和语音。在第一人称场景中,镜头意图用于指定观察者的运动;在第三人称场景中,镜头与角色之间的动态关系则从数据中学习。离散指令和连续姿态会映射到统一的米制相对六自由度轨迹。研究团队通过专用数据引擎和渐进式训练,支持长时段生成,并保持环境音与语音同步。公开世界模型基准测试显示,该模型具备较强的轨
小米董事长兼 CEO 雷军介绍了两款搭载新一代玄戒芯片的原型机。玄戒 O100 原型机采用 O3 与 O100 双芯协同计算,面向端侧 AI 模型;小米称,搭载 MiMo 模型后,实测推理速度最高可达每秒 295 个 Token。AI Cube 原型机则整合 O3、O100 和 D100 三款芯片,配备 80GB 统一内存,可运行参数量达 1200 亿的模型及较小的端侧模型。目前两款设备均为原型机
英伟达使用 SemiAnalysis 的 AgentX 工作负载和 1.6 万亿参数的 DeepSeek-V4-PRO 模型,对 Vera Rubin 进行了评估。公开结果显示,Vera Rubin NVL72 的每兆瓦 Token 吞吐量约为 GB300 NVL72 的 30 倍。该基准测试主要评估智能体编程推理工作负载,指标包括端到端延迟、首个 Token 延迟以及生成阶段性能。测试还显示,G
Block3D是一种文本到3D生成扩散框架,将离散的形状标记序列划分为连续区块。该方法以自回归方式生成各区块,同时对当前区块中的所有标记进行联合去噪。基于置信度的区块内校正机制会在每个区块最终确定前修正低置信度标记。在TRELLIS-500K的留出数据集上,Block3D将端到端平均生成时间从25.71秒缩短至4.99秒,相比经过微调的自回归基线提速5.15倍,同时未牺牲几何保真度。
MobilePA-Bench 是一个用于评估移动 AI 智能体工具调用和长期规划能力的交互式基准。其可执行沙盒维护实时应用数据库并返回结构化反馈,覆盖 13 个功能领域和 212 个真实移动工具。测试还考察子智能体协作、记忆使用和可复用技能调用。实验表明,即使是当前领先的大语言模型,在严格的工具调用顺序、权限限制和意外运行时错误下仍然不够可靠。
据蓝鲸科技报道,老板电器正在研发新一代AI烹饪眼镜,预计明年3月正式发布。与仅用于线下体验展示的第一代产品不同,新品将面向消费者销售。产品重量预计比约89克的前代机型更轻,显示方案将从全彩改为单色,供电方式则改为可更换电池。软件方面,新品搭载“食神”AI烹饪大模型,具备面向厨房场景的AI算法以及与厨电联动的逻辑。相关算法由老板电器成都算法团队开发,光波导光学模组由谷东智能提供。目前报道内容主要涉及
据《华尔街日报》报道,中国 AI 模型与美国头部模型的差距已缩小至数个月。报道认为,这并非源于短期突然出现的技术突破,而是清华大学等高校长期形成的人才网络、开源技术、海外人才回流以及更高的算力利用效率共同推动的结果。智谱 AI 联合创始人唐杰、月之暗面创始人杨植麟和 DeepSeek 创始人梁文锋,是其中具有代表性的关键人物。DeepSeek 通过多头潜在注意力机制和混合专家模型降低了内存消耗与计
GameXpert-Bench用于评估AI编程智能体在完整游戏开发生命周期中的能力。测试包括三个部分:GameGen评估智能体能否根据一次请求创建完整游戏;GameFix评估缺陷诊断与修复能力;GameOpt则衡量多轮交互中的持续优化能力。评估采用实时游戏交互、确定性行为测试,以及带回归检查的最终产品标准。该基准包含11个游戏类型的97项生成任务、100项修复任务,以及17条优化链;每项修复任务都
研究人员提出R2-OPD,以解决语言模型后训练中在线蒸馏(OPD)的一项局限。标准OPD将教师模型产生的奖励视为推理进展的可靠指标,但有些偏离教师输出的推理步骤实际上更有助于解决问题,却可能因此获得较低奖励。R2-OPD分别依据教师奖励和独立估计的推理进展,对同一轨迹中的推理片段进行排序。当两种排序不一致时,该方法会抑制相应的蒸馏信号,同时保留有效的教师指导。作者报告称,与标准OPD相比,该方法能
ReWorld是一种交互式世界模型,能够跟随用户操作、记住曾展示过的地点,并实时生成视频。其训练过程将短期控制与长期记忆分离:大多数注意力头关注近期历史,少数全局注意力头则访问完整历史。推理时,模型将有容量限制的KV缓存与按相机姿态索引的地标库结合,用于检索靠近当前位置的历史信息。训练数据涵盖Unreal渲染场景、游戏环境和真实世界视频,并统一到相同的物理动作尺度。通过蒸馏,采样步骤减少到4步,使
字节跳动发布面向生产力场景的 AI Agent 产品“豆包工作”。该产品可根据用户目标拆解任务、调用工具,并持续推进复杂工作流程。通过与飞书深度整合,豆包工作可在用户授权范围内调用聊天记录、文档、会议纪要和日程等企业上下文,以完成内容生成、数据分析、资料整理等工作。它支持创建和编辑文档、表格、PPT、图片、视频、网页及应用,也能操作浏览器和电脑。需要长时间运行的任务可交由云电脑继续执行,即使用户设
RISE 是一种面向世界行动模型的自适应框架,根据继续模拟未来场景对规划的预期收益,决定是否进行后续 rollout。Latent Evaluator 会评估当前 rollout 前缀揭示的风险,以及继续想象可能带来的规划改进空间;Rollout Gate 则在预期收益与额外计算成本之间进行权衡。研究团队还构建了反事实驾驶数据集 CounterDrive,涵盖多样化结果和风险等级。在 NAVSIM