KaiNinja 将原生 3D 生成器扩展到部件级别
原生 3D 生成器通常会将单张图像转换为一个融合的单一网格,但编辑、绑定和仿真需要独立的部件资产。KaiNinja 通过能够表示部件接触界面的双体积表示,将 TRELLIS.2 扩展到部件级生成。该方法无需额外的分割模型即可生成部件级资产,同时保持基础模型的速度和质量。训练数据包括 CAD 模型,以及由 LLM 驱动代理创建的资产。作者称,与采用不同范式的部件生成流程相比,KaiNinja 将完整
AI 新闻中心 过去24小时分析了 232 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
原生 3D 生成器通常会将单张图像转换为一个融合的单一网格,但编辑、绑定和仿真需要独立的部件资产。KaiNinja 通过能够表示部件接触界面的双体积表示,将 TRELLIS.2 扩展到部件级生成。该方法无需额外的分割模型即可生成部件级资产,同时保持基础模型的速度和质量。训练数据包括 CAD 模型,以及由 LLM 驱动代理创建的资产。作者称,与采用不同范式的部件生成流程相比,KaiNinja 将完整
Atria Dawn Preview是一款面向科学研究和工程工作流的智能体语言模型。该模型通过“可验证经验管线”训练,将工具交互连接到可执行环境和经外部验证的结果。在涵盖研究、工程和数字工作的16项基准测试中,Atria Dawn的表现可与前沿智能体竞争,并在其中5项取得已公布的最高分。对56名参与者完成的769项任务进行分析发现,人类仍掌握大多数最终决策,而智能体经常提出方法并实施修改。参与者认
Alphabet旗下自动驾驶企业Waymo计划于2027年在日本东京全面推出商业Robotaxi服务,具体时间取决于日本中央和地方政府的监管批准。Waymo早在2024年12月就公布了进军日本的计划,并自2025年起与出租车企业日本交通及出行平台GO合作,开展有人监督的自动驾驶实地测试。该服务将从少量车辆起步,随后逐步扩展至约100辆,覆盖东京主要街区。
OpenAI能力研究员丹·塞尔瑟姆在一份公开的个人人工智能风险声明中表示,顶尖模型似乎正变得越来越具备情境感知能力,这可能使人类更难可靠地评估它们的能力和行为。他还警告称,人们正越来越依赖人工智能来引导研究。这些说法属于个人观点,并未提供证明新能力或重大技术突破的独立证据。
ZGCM-1 是一个完全开放、从零训练的 70 亿参数稠密型基础模型,面向数学推理和智能体搜索。其训练方案支持 256K 上下文,结合交错式门控滑动窗口注意力与全注意力机制,并采用 FP8 Muon 优化器和分阶段上下文扩展。该模型通过有意推理和调用外部工具,弥补小型模型参数容量有限的问题。研究团队称,ZGCM-1-7B 在通用基准测试中具备与同规模 7B 模型竞争的性能,并在部分数学推理和智能体
美国总统唐纳德·特朗普在一场行业峰会期间致电英伟达 CEO 黄仁勋,再次为人工智能辩护。特朗普将外界对 AI 安全的担忧称为“骗局”,表示机器人不会接管世界,AI 也不会统治世界。他还称赞数据中心,认为其将成为未来 20 至 25 年的重要经济资产。美国总统科学与技术顾问委员会联合主席戴维·萨克斯则表示,Anthropic 和 OpenAI 应开发安全产品,必要时可在没有政府干预的情况下按自身节奏
字节跳动 CEO 梁汝波表示,过去 50 年 IT 行业经历了 PC、Web、移动和 AI 四次主要发展高峰,AI 高峰的规模远超前三次。尽管目前大语言模型与海外领先模型存在差距,字节跳动仍将坚持自研,接受短期落后并持续优化。公司称,视频生成模型 Seedance 仍保持前沿水平。字节跳动还在整合豆包、飞书和火山引擎的产品及企业服务团队,以加强面向办公和生产力场景的 AI 产品与服务。据称,飞书新
一名最近从谷歌DeepMind离职的人工智能研究人员警告称,人类留给自己的时间已经不多,必须阻止人工智能造成广泛危害。他是最新一位对这项技术发展方向表达担忧的现任或前员工。
Vidu S2由Vidu S2-Avatar和Vidu S2-Editing组成,前者是实时交互式数字角色模型,后者是实时视频编辑模型。研究团队还探索了两者进行实时空间视频生成的可行性。与Vidu S1相比,S2-Avatar支持实时生成720p视频,能够使用可随时更新的动态参考内容,并更好地遵循跳舞等指令。S2-Editing可以实时编辑视频流,包括风格渲染以及服装、角色和背景替换。根据公布的实
一项研究提出了一种方法,在多模态大语言模型的强化学习后训练过程中动态调整训练提示词的分布。探索潜力评分(EPS)利用在线策略回滚统计数据,估计提示词能够提供的学习价值。该方法不直接丢弃低价值提示词,而是让教师模型在保留原始任务意图的前提下进行改写,从而产生更有信息量的训练信号。与GRPO结合后,该方法在Geo3K和MMK12上均超过基线,域内相对提升最高达9.7%,在MathVision和MMMU
PhysBrain 1.5 是一个用于理解物理环境、生成动作和预测未来状态的统一模型。它将语言响应、末端执行器运动和视觉目标编码为离散序列,并通过自回归下一词预测进行联合训练。预训练完全采用人类交互视频,随后使用人类示范、机器人轨迹和模拟经验进行监督微调。作者称,这个拥有80亿参数的开源模型在28项具身理解基准测试中平均得分72.5,并在其中14项取得开源模型最佳成绩。这些性能数据属于作者报告,仍
据报道,英国国王查尔斯三世计划本周在苏格兰邓弗里斯主持一场峰会,邀请多家大型科技公司的高管讨论人工智能。受邀者据称包括英伟达首席执行官黄仁勋、谷歌DeepMind董事长德米斯·哈萨比斯和OpenAI首席财务官莎拉·弗里亚,以及Anthropic、IonQ、英国政府和梵蒂冈的代表。会议将讨论如何让人工智能发展造福社会,以及制定共同准则是否有助于推动负责任的创新。目前尚未确认任何具体法规、协议或技术发
四川省眉山市永丰村一处300亩水稻试点田首次采用水稻专用AI大模型进行田间管理。无人机负责采集农田数据,系统在插秧、水肥调控和病虫害预警等环节提供建议。专家按照规范测产,三个核心品种的亩产达到826.8至863.6公斤。试点田亩产较2023年提高152.6公斤。研究人员表示,良种、栽培技术与AI精准管理相结合,可能形成可向其他地区推广的增产技术路径。
Tedium 介绍了 iLands,这是一家为客户匹配 AI 代理、提供各种服务的公司。该公司的代理在两天内多次发送未经请求的邮件,通常推销约 25 美元的服务,包括研究协助。
LLaDA-UI 是一个拥有 167 亿参数的 GUI 智能体,将混合专家架构与分块扩散生成相结合。该系统先进行多模态预训练,随后使用移动端、桌面端、网页界面和视觉定位数据进行有监督微调。在多项定位与导航基准测试中,LLaDA-UI 的表现超过 Qwen2.5-VL-7B,并在报告的六项 GUI 基准中的四项超过 Qwen3-VL-8B。研究结果表明,分块扩散可以成为多模态 GUI 智能体的一种实