MiMo-V2.6:扩大强化学习规模,推动模型自我改进
报告介绍了多模态模型系列 MiMo-V2.6,通过扩大强化学习(RL)的计算规模来提升模型能力。其流程先使用广泛的多模态数据进行中期训练,再在编程、通用任务、视觉和网络安全等多种环境中开展 RL。异步训练系统每步处理 1,568 个样本和 27 亿至 37 亿个 token,支持最长 100 万 token 的上下文。分组式智能体评估旨在改善长周期任务的奖励信号。报告还介绍了稳定大规模训练及防范奖
AI 新闻中心 过去24小时分析了 165 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
报告介绍了多模态模型系列 MiMo-V2.6,通过扩大强化学习(RL)的计算规模来提升模型能力。其流程先使用广泛的多模态数据进行中期训练,再在编程、通用任务、视觉和网络安全等多种环境中开展 RL。异步训练系统每步处理 1,568 个样本和 27 亿至 37 亿个 token,支持最长 100 万 token 的上下文。分组式智能体评估旨在改善长周期任务的奖励信号。报告还介绍了稳定大规模训练及防范奖
据英国《金融时报》报道,软银创始人孙正义正寻求向海湾地区投资者募资最多1000亿美元,用于扩大AI投资。资金可能用于设立一只收购企业、再借助AI及其他先进技术改善运营的基金;软银旗下机器人及物理AI业务Roze预计将发挥重要作用。OpenAI推迟IPO后,投资者对软银高度集中于AI、尤其是OpenAI相关投资的风险更加关注。募资尚未落实。软银近期还发行了高收益债券,并以Arm持股等资产作为借款支撑
有报道称,谷歌传闻中的下一代模型 Gemini 4 Argon 已向部分 Pro 用户开放,并接入 Google Cloud 和编程工具 Antigravity。报道还称,该模型能够向真实代码库直接提交代码。谷歌员工据称也在软件开发、代码迁移和量子计算领域测试该模型。文章没有提供支持这些说法的独立证据。
最新民调显示,美国民众对人工智能快速发展的担忧跨越党派。64%的受访者认为发展速度过快,近八成要求政府确保AI安全、维持人类控制并保护劳动者。数据中心及政府对AI的处理方式也日益成为政治议题。民众在风险管控和劳工保护上有较高共识,但在经济竞争与环境保护的优先事项上仍存在分歧。
DreamTrue是一种面向不同机器人构型的多视角世界模型,旨在预测忠实遵循动作且符合物理规律的视频。该方法通过离线几何校准,将渲染出的动作轨迹与目标视频对齐。反事实后训练会修改记录的动作,并针对更多接触配置生成预测,以扩大交互情境的覆盖范围。研究团队使用人工标注的交互缺陷数据训练视频奖励模型,并以其评分指导强化学习后训练。研究者称,DreamTrue在AgiBot上的动作跟随表现达到当时最佳,人
中国国家知识产权局公布了比亚迪一项人形机器人外观设计专利。该设计面向具备行走、平衡和交互功能的机器人,可能用于服务、教育或工业场景。比亚迪执行副总裁李柯今年6月表示,公司希望未来在每家门店部署两至三台机器人,用于向顾客介绍和演示车辆。该专利涉及机器人外观,并不意味着产品已经完成或部署时间已经确定。
富兰克林邓普顿首席执行官珍妮·约翰逊认为,投资人工智能仍是一项具有长期持续性的机遇。她在2026年米尔肯研究院亚洲峰会期间接受了哈斯琳达·阿敏的采访。
AgentGarten 是一个构建交互式虚拟环境的框架,AI 智能体可通过探索和互动进行学习。模拟器与游戏引擎负责维护持久的世界状态和交互规则,共用的神经渲染器则实时生成视觉观测。研究团队将预训练视频模型适配到几何条件,并通过 Adversarial Forcing 和真实数据监督进行训练。在实验中,智能体经过 4 轮经验便能学习,而传统强化学习对照方法需要数百万轮。结果表明,该方法在测试环境中提
JetBrains 发布了采用 Apache 2.0 许可证、主打智能体编程的 Mellum 2.1。该模型延续 Mellum 2 的混合专家架构,总参数量为 120 亿,活跃参数量为 25 亿。此次更新扩展了强化学习训练,并补充数学、算法竞赛、科学、工具使用和软件工程等领域的数据。JetBrains 表示,模型能够探索代码库、编辑文件并检查修改结果。多 Token 预测可使单请求速度提升约 1.
据英国《金融时报》报道,软银集团正寻求从海湾地区投资者处筹集至多1000亿美元,以扩大其人工智能投资。
中国科技硬件股在年初大幅上涨后迅速失去价值。市场对全球人工智能投资热潮的疑虑不断增加,使估值较高的股票尤其容易受到冲击。
Anthropic正在为2028年美国大选筹备一项计划,向两党总统候选人介绍人工智能政策。据《财富》杂志报道,该公司正在为此组建内部团队。
自我中心世界模型根据智能体的视角预测观测结果,但大多数模型只关注单个智能体。ME-World对多个智能体在共享环境中通过细粒度动作进行交互的情形建模,并同步联合生成各自的第一人称视频流。该模型利用所有智能体的目标视角姿态和共享环境记忆,保持视角、动作以及交互引发的状态变化之间的一致性。在真实和合成数据上的评估显示,与现有方法相比,ME-World提升了共享世界一致性、动作控制、身份保持和视频质量。
Learn2Play Bench是一套文本游戏基准测试,游戏规则新颖或反直觉,智能体必须通过互动来学习。该基准旨在区分经验学习与依靠预训练知识进行推理。可复现的反馈和自动评分支持对多次尝试进行受控评估;不同的游戏实例则用于检验智能体能否将所学应用于新情境。研究发现,保留完整的行动和反馈记录,可能比将经验概括为规则或策略更有助于学习。顶尖人类玩家的最高分高于受测智能体,并会尝试更多样的策略。此外,在
美国亚特兰大一个四人团队正借助 AI 生成代码开发 ArtCraft,这是一套试图替代 Adobe Creative Cloud 的免费开源软件。PhotoCraft 对标 Photoshop,LightCraft 则面向 Lightroom 用户。该套件计划提供相近功能,同时取消账户注册、云服务、遥测数据收集和月度订阅费用。ArtCraft 旗下应用仍在开发中,部分产品尚处于早期 Alpha 测